这张卡帮你把「模型瞎编」从情绪化抱怨拆成可定位、可治理的工程问题。

核心拆解:幻觉指模型生成看似可信却与事实不符的内容,根源是概率式生成机制而非故障。现场最关键的动作是归因:检索没召回正确依据、召回了但模型没用、还是知识库本身错了——三类问题治法完全不同,混在一起就永远在改提示词。治理分层也讲配比:事实类幻觉靠检索锚定与引用溯源,推理类靠评测约束与人工审核,指望提示词里一句「不要编造」消灭幻觉不现实。

增量判断:国内客户常把幻觉当成可以签约消除的缺陷。FDE 的增量话术是承认概率边界、展示治理证据链:评测集上的错误率数字加引用溯源机制,比承诺零幻觉更能建立信任并保住验收。

行动建议:把最近十次「瞎编」投诉逐条归因到检索、生成或数据,统计分布后再定治理动作。分布本身就能指导治理资源投向哪一层。

—— FDEChina编辑部 · 实战派

定义

幻觉(Hallucination)指模型生成内容看似流畅可信、实则与事实不符或凭空捏造的现象,根源在于概率式生成机制——模型预测的是「像真的」而非「是真的」。

展开

治理幻觉的第一步是归因:该查到的没查到是检索问题,该换用检索增强生成而不是改提示词;查到了但模型无视证据是生成问题,靠重排序、证据约束与更严格的提示词;知识库本身错误则要回溯数据治理流程,与模型无关。幻觉本身还分事实类与推理类:前者编造事实、数字与引用,靠检索锚定与引用溯源压低;后者在逻辑链上跑偏,靠分步约束与人工审核兜底。常见误用是把「不要编造」写进系统提示词就当治理完成,提示词能压低频次,压不到零。FDE 验收语境下,务实的做法是承认概率边界、用评测集上的错误率与溯源机制证明风险可控,而不是签下零幻觉承诺——那等于签下一张必然违约的保票。

参见

AI 智能体评测入门评测基线手册RAG 专题