这张卡回答一个根本问题:为什么评测是 AI 交付的第一块地基。

核心拆解:评测是用一组定义好的任务与标准,量化系统在目标场景上的表现。软件交付里功能对不对有确定性答案,LLM 输出没有,没有评测就只能靠手感与演示,客户上生产后每个边角案例都变成事故。最容易犯的错是顺序反了:先堆功能、出事才补评测,此时连「改好还是改坏」都无法回答。先建基线再迭代,是唯一可辩护的顺序。

增量判断:行业共识已从「评测是学术活动」转向「评测是产品能力」,国内落地要叠加两点:客户场景数据不可出域,评测集要在客户环境内构建;业务方语言与工程指标要互相翻译,验收标准才能谈拢。

行动建议:为你最重要的一个交付物列出五到十个核心场景,作为评测集的第一版骨架。评测口径谈不拢,后面所有指标都失去意义,先对齐口径再开工,别怕花时间。

—— FDEChina编辑部 · 架构师视角

定义

评测(Eval)指用一组定义好的任务、输入与评判标准,量化大模型或智能体在目标场景上表现的系统化方法,是 AI 交付中替代「手感」与「演示」的质量度量体系。

展开

FDE 在客户现场为什么在乎评测:因为传统软件的「功能对不对」有确定性答案,LLM 系统没有——同一个输入今天对明天错,没有评测就无法回答「这次改动是变好还是变坏」,也无法把验收从演示运气变成可复现的证据。评测与相邻概念的分工:测试验证特定输入的预期行为,偏工程回归;评测覆盖模型输出的质量分布,偏产品验收;监控看线上运行状态,是评测结论在生产侧的延伸。最常犯的错误是顺序颠倒——先堆功能、出了问题才补评测,此时连回归测试的地基都没有。正确顺序是先建评测基线再开始迭代,评测集跟着业务场景走,而不是拿通用榜单分数冒充场景能力。

参见

评测基线手册AI 智能体评测入门FDE 实战指南