职位描述
本岗位面向 Agent 应用的数据构建与算法优化,围绕真实业务核心场景,通过高质量数据、结构化知识、科学评测与精准归因,系统性提升 AI 应用在业务场景中的效果上限与稳定性,将 AI 转化为业务增长引擎。
本岗位适合希望从事以下工作的候选人投递:
- 希望从事 AI 应用数据构建与自动化评测工作的候选人;
- 希望从事模型后训练与 Agent 强化学习优化工作的候选人;
- 希望从事多模态 AI 应用算法优化工作的候选人。
具体职责包括以下相关方向的一项或多项(共同前提:深入业务场景完成问题建模与优化目标定义,围绕上下文工程持续开展效果归因与迭代):
一、数据引擎与数据飞轮构建
- 建设多源异构数据的接入、清洗、加工与服务化管道,为训练与评测提供稳定的数据供给;
- 打造高质量数据生产链路,探索合成数据(Synthetic Data)、动作轨迹(Trajectory)构造与高效蒸馏方案,跑通"业务—模型—反馈"的迭代闭环。
二、知识体系建设
- 设计语义层、本体与知识图谱、业务规则的结构化表达,沉淀高维知识资产;
- 负责知识库(RAG)与记忆系统(Memory)的知识组织、切分策略与召回质量优化,持续提升上下文的准确性与信息密度。
三、评测体系构建
- 面向业务目标设计完备的效果评估体系,构建自动化评测框架与 LLM-as-a-Judge 方案;
- 建设覆盖复杂多步任务的量化评估能力,建立离线评估与在线业务指标联动的评价闭环。
四、归因、因果分析与长程优化**
- 建立 Agent 的系统化诊断与归因能力,通过因果分析与信用分配(Credit Assignment)定位长程任务中的失效环节,识别问题归属于数据、知识、上下文、策略或模型;
- 构建"评测—归因—调优—回归"的自动化迭代闭环(Loop),持续提升长程任务的成功率与稳定性。
五、模型后训练与强化学习优化**
- 基于业务数据开展 SFT、DPO 等偏好优化及 Agentic RL 训练;
- 设计可工程化的 Reward 体系与 RL 训练环境,包括环境模拟与奖励验证,提升模型在垂直业务场景中的可控性、鲁棒性与泛化能力。
职位要求
基础要求
一、专业背景
计算机、数学、统计学等相关专业硕士、博士优先,优秀本科生不受限制。
二、数据构建能力
具备较强的 Data-centric AI 意识,精通后训练所需高质量数据的挖掘、清洗与构造;具备多源异构数据管道建设经验;有合成数据(Synthetic Data)与动作轨迹(Trajectory)构建实操经验者优先。
三、评测能力
能够针对 Agent 任务设计科学的评测体系(LLM-as-a-Judge),并基于评测结果精准分析与定位问题;具备复杂多步任务量化评估、评测集设计与标注质量控制能力者优先。
四、归因与长程优化能力**
具备 Agent 应用的归因分析、因果分析与调优经验;能够构建自动化迭代闭环(Loop),推动长程任务的持续优化;能够从数据、知识、上下文、策略、模型等多个维度形成系统性优化判断。
五、模型理解与后训练能力
深入理解 Transformer 与主流 LLM 架构演进原理;对后训练算法(SFT、DPO 等偏好优化方法、RL)具备实操经验与深刻认知,拥有 Agentic RL 训练实操经验者优先。
六、知识组织能力
理解 RAG 与 Memory 的原理与能力瓶颈,对语义层、本体、知识图谱等知识组织方式具备实践经验或深入理解;掌握召回质量评估与上下文优化的方法论。
七、代码与工程能力
具备较强的 Python 编程能力,熟练掌握 PyTorch;了解大模型训练与推理框架(Megatron-LM、vLLM、DeepSpeed 等),能够高效处理分布式环境下的工程问题;了解主流 AI 协议与生态(MCP、Skills 等)。
八、技术热情与自驱
对前沿技术保持高度关注,能够独立研读论文与技术报告并快速复现,主动尝试落地先进开源项目;对主流 AI 开源项目有贡献者优先。
加分项
一、学术与开源影响力
- 在 AI 顶级会议(ACL、EMNLP、ICLR、NeurIPS、ICML 等)发表大模型评测、数据合成、Agent、RL 相关第一作者或共同第一作者论文;
- 知名大模型评测框架、高质量开源数据集或主流 Agent、RL 框架的核心贡献者。
二、长程优化与 Agentic RL 方向
- 熟悉 GRPO、RL等 Agentic RL 训练算法,或具备 Reward 建模、过程奖励模型(PRM)实践经验;
- 具备 Agent 全链路可观测与多维归因体系的建设经验,能够定位长程任务的失效根因。
三、综合素质
- 具备扎实的数学功底与逻辑分析能力,对高质量数据与评测拥有端到端闭环经验;
- 独立开发过具备一定影响力的 AI 应用或评测、数据类工具。