职位描述
聚焦淘天核心业务与真实应用场景,你将参与淘天 AI 核心平台建设,围绕 AI Agent 在理解、推理、规划、执行等关键能力开展持续优化,通过数据分析、Agent 评测、实验验证及策略优化等方式构建数据飞轮,推动 Agent 能力持续迭代,并提升其在复杂真实业务场景中的任务完成效果与业务价值。
1. 负责 AI Agent 核心能力优化,围绕任务规划、推理、工具调用、记忆、知识增强、多智能体协作等关键能力开展算法研究与优化,持续提升 Agent 在复杂任务中的执行效果。
2. 建立 AI Agent 全生命周期评测体系,设计离线评测集、自动化评测流程及线上评估指标,结合真实业务场景分析 Agent 在理解、推理、执行及交互过程中的能力瓶颈,并持续推动优化迭代。
3. 基于海量用户行为数据、模型输出及运行日志,开展数据分析、误差分析及实验验证,定位影响 Agent 效果的关键因素,制定数据驱动的优化方案,持续提升任务成功率、执行效率及用户满意度。
4. 研究大语言模型在 AI Agent 场景下的能力边界及优化方法,结合 Prompt Engineering、上下文学习(In-Context Learning)、RAG、工作流编排、策略优化等技术,不断提升 Agent 在复杂业务中的泛化能力和稳定性。
5. 参与 Agent 数据体系建设,负责训练数据、评测数据、偏好数据及高质量样本构建,持续完善数据质量分析及自动化评测能力,为 Agent 持续优化提供数据支撑。
6. 结合离线实验、在线实验(A/B Test)及业务反馈,持续迭代 Agent 能力,建立从问题发现、原因分析、策略优化到效果验证的完整闭环,推动 Agent 能力持续演进。
7. 跟踪大语言模型及 AI Agent 领域前沿技术,结合业务需求开展新算法、新框架及新优化策略的探索与落地。
职位要求
1. 硕士及以上学历,计算机、人工智能、软件工程、数学、统计学等相关专业,具备扎实的机器学习、深度学习及自然语言处理基础。
2. 熟悉 Transformer、大语言模型及 AI Agent 技术体系,深入理解模型训练与推理机制,掌握 Prompt Engineering、RAG、Function Calling、Planning、Memory、Multi-Agent、Agent Workflow 等关键技术,并具备相关实践经验。
3. 熟悉监督微调、强化学习等模型优化方法,理解模型能力对齐、模型评测等相关技术,有大模型应用优化或 Agent 优化经验者优先。
4. 熟练掌握 Python,熟悉 PyTorch、TensorFlow 等至少一种深度学习框架,具备扎实的算法实现能力和良好的工程开发能力。
5. 熟悉模型评测体系及实验设计方法,能够构建科学的评估指标,熟练运用离线评测、在线实验(A/B Test)、日志分析及误差分析等方法持续优化 Agent 效果。
6. 具备扎实的数据分析能力,熟悉 SQL、Pandas、NumPy 等数据处理工具,能够从海量数据中发现规律,分析模型问题,并形成可落地的优化方案。
7. 具备优秀的问题抽象、技术研究及创新能力,能够快速理解复杂业务场景,设计并验证算法方案,持续推动 AI Agent 能力优化及业务价值提升。
加分项:
1. 在AI顶会(ACL/EMNLP/ICLR/NeurIPS/ICML等)发表大模型评测、数据合成、Agent、RL相关一作或共一论文。
2. 知名大模型评测框架或高质量开源数据核心贡献者。
3. 极强的数学功底和逻辑分析能力,对高质量数据和评测有端到端闭环经验。