这张卡讲清护栏与评测这对最容易混用的概念的分界。

核心拆解:护栏是在输入输出两侧强制执行的安全检查层,拦越权请求、拦敏感信息、拦危险操作、拦越界输出。最关键的分界:评测负责发现问题,护栏负责运行时拦截,用评测思维做护栏会把验收指标做成交数,而护栏的核心指标是拦住了什么和误拦了多少。常见误用是把护栏全堆在提示词层——文本约束对注入攻击的抵抗力有限,权限与工具层的硬边界才是底线。

增量判断:国内合规语境给护栏加了硬约束项:内容安全、个人信息保护、日志留存都有明确要求,客户方安全部门的评审标准比通用安全实践更严。FDE 要把护栏设计写进方案并用红队测试验证,而不是当成上线前的补丁。

行动建议:列出你系统的输入输出风险清单,为每条标注拦截层——提示词、分类器、权限还是工具层。

—— FDEChina编辑部 · 实战派

定义

护栏(Guardrails)指在模型系统的输入与输出两侧强制执行的安全检查层,用于拦截越权请求、敏感信息外泄、危险操作与越界内容,是运行时的强制边界而非建议。

展开

护栏与评测的分界要分清:评测在离线阶段找问题、量化风险,护栏在线上拦截问题、执行边界——拿评测指标当护栏会把两者都做弱。常见误用是把护栏全部做在提示词层,文本约束对提示词注入的抵抗力有限,真正的硬边界在权限与工具层:数据库账号只给只读、删除类操作要人工确认、外部调用走白名单。分层设计是正解——输入侧分类器、模型层系统提示词、工具层权限、输出侧内容过滤,各管一段。误拦率是护栏的第二指标:拦得太宽,用户绕行或弃用,护栏形同虚设;FDE 交付时要连同误拦率一起进评测基线,并用红队测试验证拦截有效性,国内合规语境下内容安全与个人信息保护要求会进一步抬高这层的验收标准。

参见

智能体上线检查清单智能体专题FDE 实战指南