这张卡帮你把「上 RAG」从一个流行词还原成一条可评测的工程链路。
核心拆解:RAG 由检索与生成两段构成,失败也分两类——该查到的没查到是检索问题,查到了没用好是生成问题,修法完全不同。切块策略、召回排序、查询改写、权限过滤、证据遵循,每一环都可能单独失败。现场最常见的错误是把它们混在一起排查,一失败就改提示词或换模型,实际多数问题出在检索环节。分环节建评测集是定位的前提,不是可选项。
增量判断:市面教程集中在向量检索调参,这张卡的增量是交付视角——企业知识库的权限过滤与数据时效常比相似度算法更决定成败:客户不会原谅检索结果泄露无权文档,也不会原谅上周更新的制度查不到,这些必须在评测基线里显式覆盖。
行动建议:把 RAG 评测拆成检索命中与答案质量两组指标,下次失败先看检索召回率。先定位环节再动手改。
—— FDEChina编辑部 · 实战派
定义
检索增强生成(RAG,Retrieval-Augmented Generation)指在模型作答前,先从外部知识库检索相关内容,再把检索结果作为证据注入提示词、让模型基于证据生成答案的技术模式。
展开
RAG 链路的每一环都可能失败:切块策略把完整语义切碎、检索没召回关键文档、召回结果没做权限过滤、模型无视证据自说自话。FDE 现场最常见的错误是把这些混在一起排查,一失败就改提示词或换模型。正确做法是分环节评测——用「该命中是否命中」测检索,用「给定证据答案是否正确」测生成,两类问题的修法完全不同。与微调的辨析:RAG 改变的是模型能看见什么,适合知识与事实频繁更新的场景;微调改变的是模型行为方式,适合固定风格与格式,两者可叠加但不可互相替代。
企业交付中,权限过滤与数据时效常比相似度算法更影响验收:客户不会原谅检索结果泄露无权文档,也不会原谅上周更新的制度查不到。这些点必须在评测基线里显式覆盖,而不是等到验收现场才发现。