职位描述
我们是淘宝闪购AI2C工程团队,负责把AI能力工程化、把产品形态落到线上、保障交付与稳定性。团队的目标是通过提升闪购Agent的智能化能力提升用户体验 我们在做一件什么样的事:即时电商Agent。不是给现有App再加一个AI入口,而是让用户跨多个工具/路径完成的购物动作被一个Agent合二为一、显著缩短路径。当前每天的Token消耗量在万亿级别 我们能给你: 一个真问题:每天百万用户,万亿token的交易类 Agent场景。不是Demo、不是过程指标,是买单过的绝对值 算法+产品+工程三方真协作环境,不是工程团队闭门造车 把你的判断直接变成线上Agent的空间——Context 给够、决策权下放,不做执行手 和团队一起,把"即时电商Agent"从命题做成订单 岗位职责: 搭Agent能力闭环:规划并落地Agent的认知/执行loop——可观测(步骤结构化、产出落盘、可回溯、可局部重跑)、有Before/After的错误率/成功率对比、有真实样本流入流出的漏斗 Agent-First 架构:用AI的垂直扩容替代之前的水平扩容,把分散在多人多系统里的上下文收回到一个Agent 里。对Agent架构的性能、成本、稳定性有优化经验 把"建了什么"变成"流过多少":不追求"建了 5 个Harness/1000条评测集",而是回答——客户是谁、解决了什么问题、本周流入多少样本、流出多少解、漏斗卡在哪 评测作为一级工程资产:不是上线前临时拉一份评测,而是专人持续维护、每周滚动输入,既驱动模型/能力优化,又反哺场景验证 跨方协作:和算法组、产品组深度对齐,把能力工程化、把形态落线上;关键项目把相关方拉进来一起做成,形成AI Native Team
职位要求
必须项: 3 年以上工程研发经验,至少1年LLM Agent方向实战(不是看过、是做过、能说清Before/After) 主导过一个Agent/RAG/Tool-Use闭环的工程落地,能讲清loop的入口在哪、样本怎么流入、卡点在哪 理解"评测是工程资产"而非辅助工具,做过评测体系建设或Bad Case治理 Java/Python工程能力扎实,能独立完成从架构到上线到稳定性保障全链路 加分项: 即时零售 / 电商交易域经验(商品、订单、营销、搜索推荐任一) 主导过千问/通义这类大模型在业务侧的工程化接入与放量 有Agent可观测/Trace体系的落地经验 有团队带人或技术Lead经验,能给Context不Control,把人送上loop而不是替人跑 我们特别看重的几条(团队文化底色): 需求驱动:先回答"客户是谁、解决什么",再讲"我建了什么" 知行合一:对外只输出认知,不输出观点。说出的结论要自己验证过、买过单,而不是看几篇公众号复述