FDE中国 · 从业者与关注者的专业知识、实践与行业资料 新手指南关于版权说明
主题归档

评测

按频道与主题浏览 FDEChina 的全部内容。

41
共 41 篇按时间排序
内容

评测基线建设 Playbook:把「感觉可用」变成可回归的数字

这篇从架构师视角给出 Agent 项目评测基线的完整建设流程:七个编号步骤覆盖用例收集、... 交付实战· 内容 ·来源见原文 ·2026-08-18
内容

A/B 测试:A/B Testing

一张术语卡讲清 A/B 测试在 AI 系统中的形态与门槛:将流量随机分组对比新旧版本的业... 交付实战· 内容 ·来源见原文 ·2026-08-18
内容

AI Agent 项目上线前检查清单:从评测到移交的五组关口

把 Agent 系统从「演示能跑」推进到「敢交给客户用」,中间隔着评测、安全、成本、运维... 交付实战· 内容 ·来源见原文 ·2026-08-18
内容

回归测试:Regression Testing

一张术语卡讲清回归测试在 AI 交付中的形态:每次改动后重跑评测集,确认修复没有引入新退... 交付实战· 内容 ·来源见原文 ·2026-08-15
内容

构建 LLM 系统与产品的模式:从 evals 到护栏的七种工程范式

Eugene Yan 系统梳理了把 LLM 集成进系统与产品的七种工程模式:评估(eva... 交付实战· 内容 ·eugeneyan.com ·2026-08-15
内容

评测回归模式:每次改动都跑同一套用例

AI 应用迭代快、改动面大,没有回归机制时「修好了 A 弄坏了 B」要等客户发现。这个模... 交付实战· 内容 ·来源见原文 ·2026-08-14
内容

PoC 验收清单:演示通过不等于验证通过

这篇是一份可以直接带进验收会的 PoC 验收清单,共 16 条检查项,分数据真实性、边界... 交付实战· 内容 ·来源见原文 ·2026-08-14
内容

检索增强生成:RAG(Retrieval-Augmented Generation)

一张术语卡讲清检索增强生成(RAG)的定义、链路与失败模式:先检索外部知识再让模型基于证... FDE 观察· 内容 ·来源见原文 ·2026-08-12
内容

pass@k:Pass@k 指标

一张术语卡讲清 pass@k 的定义与解读纪律:每个问题采样 k 次至少一次成功的通过率... 交付实战· 内容 ·来源见原文 ·2026-08-12
内容

红队测试:Red Teaming

一张术语卡讲清红队测试在 AI 系统中的形态:以攻击者视角系统性寻找提示词注入、越权与内... 交付实战· 内容 ·来源见原文 ·2026-08-09
内容

可观测性:Observability

一张术语卡讲清可观测性的定义与 AI 交付标准:从系统外部输出推断内部状态、支撑故障定位... 交付实战· 内容 ·来源见原文 ·2026-08-09
内容

评测:Eval

一张术语卡讲清评测在 LLM 工程中的定义与地位:用系统化方法量化模型或智能体在任务上的... 交付实战· 内容 ·来源见原文 ·2026-08-09