这张卡讲人工评测这件「贵但绕不开」的事怎么做才不浪费。

核心拆解:人工评测由人按标准对输出打分或排序,是评测可信度的最终锚点——所有自动评测的校准最后都要回到人。组织三件事决定质量:评分细则先写清再开标;标注员要培训并做一致性检验;标注过程要监控漂移。最常见的误用是拉上业务方现场「凭感觉打分」,没有细则、没有校准,标出来的数据比不标还糟,因为它披着数据外衣。

增量判断:国内交付的优势是客户业务方愿意参与共建,劣势是业务人员时间贵、波动大。FDE 的分层组合是裁判模型筛大头、人工裁决疑难与争议样本,把人工预算花在刀刃上,同时让客户在关键用例上亲手背书。

行动建议:为你最难的十类输出各写一条可操作的评分细则,先拿两条边界样本试标。细则写得越具体,人工评测的返工反而越少、预算越省。

—— FDEChina编辑部 · 架构师视角

定义

人工评测(Human Evaluation)指由人按既定标准对模型输出进行打分、排序或偏好判断的评测方式,是所有评测方法中可信度的最终锚点。

展开

人工评测贵、慢、难复现,但绕不开:模型即裁判的校准要靠人工标注,黄金数据集的预期答案要业务方确认,验收争议的最终裁决也是人。组织质量取决于三件事:评分细则先行——把「什么算好」拆成可操作条款再开标;标注员培训与一致率检验——多人背对背标注,一致率过低说明细则有歧义;过程监控——标注疲劳与标准漂移要靠定期抽检发现。最常见的误用是让业务方现场凭感觉打分,产出看似数据、实为噪声。与模型即裁判的组合是分层的:裁判模型筛掉大头,人工聚焦疑难样本与边界案例,把昂贵的人工预算花在分歧处。国内交付语境下,让客户业务方在关键用例上亲手标注,既校准了口径,也换来了对评测结论的认可,这份参与感本身就是交付的一部分。

参见

评测基线手册AI 智能体评测入门FDE 实战指南