职位描述
一、评测体系设计与指标定义:
把模糊的"用户预期未达成 / 效果不好"拆解为可量化、可归因、可执行的指标。对上负责电商搜索全链路(Query 理解、相关性、丰富性性等)的指标体系建设;面向 LLM、Agent、工具调用、多轮推理等场景,构建科学、可扩展的能力评测维度(指令遵循、推理、幻觉、安全性、工具调用等)。建立离线评测、在线人巡、A/B 测试、人工主观评估相结合的分层框架,覆盖端到端体验与质量监控。
二、数据流、流程建设与人机协作:
制定样本采样策略、标注 SOP、Badcase 分类体系,沉淀高质量评测样本集与测评集。推动大模型(LLM-as-a-judge)在规模化评测中的落地,设计 Prompt、校准机制与人工评审标准,实现自动评测与人工评测的互校验。
搭建"标准—评测—数据反馈"的闭环机制,向模型训练与方案迭代产出可用于训练的高质量偏好数据与奖励信号,提升迭代效率与评估标准的合理性。
三、问题洞察与深度归因
深入分析用户反馈、评测数据及日志,对搜索结果及 Agent 执行链路中的 Bad Case 进行系统性归因,准确定位算法策略(召回、粗排、精排、决策/工具调用等)及产品功能的硬伤,定期输出评测问题归因报告。
持续跟踪行业前沿 Benchmark、评测方法与模型能力演进,做竞品对比与行业研究,探索更贴近真实业务场景的评测范式。
四、业务驱动与闭环落地
将评测结论转化为算法、产品、运营可落地的优化方案,建立闭环验证机制,量化策略迭代与模型迭代的业务价值,推动复杂跨团队项目落地。以推动算法、模型和产品真正改好为目标,而非以"产出评测报告"为终点。
典型产出〔可按需保留/调整〕:定期评测问题归因报告、可复用的评测样本集与测评集、LLM-as-judge 校准方案与人工评审标准、支撑决策的竞品/行业研究。
职位要求
1、经验与背景
本科及以上学历,3 年以上搜索/推荐策略或 2 年以上 AI 评测产品经验,深入理解搜索/推荐系统底层链路,或深入理解大模型基本原理与常见能力维度。
2、专业能力
结构化拆解能力:能将复杂、模糊的体验问题及"效果不好"拆成可评测、可归因、可优化的指标;兼具业务审美与系统性思维,能把"美感/体验"转化为客观量化标准。
3、进阶加分
强加分:熟悉 LLM-as-judge 的校准与人工互校验实践;有 LLM/多模态与 Agent 评测设计经验。
一般加分:有 RLHF 偏好数据建设、Prompt 设计或专家评审池建设经验;了解大模型评测平台、数据标注平台、实验/A_B 平台、模型管理平台;对通用智能体有深入了解与重度使用经验。