这张卡讲语义缓存这个高性价比手段里藏着的静默风险。

核心拆解:语义缓存把历史问答存成向量,新请求按相似度命中直接返回,省掉一次完整推理,对高频重复问题降本立竿见影。风险在「相似不等于相同」:业务问题措辞差一点答案就南辕北辙,错误命中不会报错,只会静默给出错答案。纪律有三条:相似度阈值用真实流量校准而非拍脑袋;命中内容要带失效机制,知识库一更新旧缓存全部作废;高风险任务域宁可不开缓存。

增量判断:与向量数据库共用嵌入技术但目标不同:一个为检索证据,一个为复用答案,混用同一套阈值是常见错误。国内交付中缓存常被客户当成免费优化,FDE 要把命中率与错误命中风险一起摆上台面再启用。

行动建议:启用前拿真实历史请求回放测一遍缓存命中率与错误命中数,两张表一起看。缓存策略变更同样要走评测回归,别当成免检配置。

—— FDEChina编辑部 · 实战派

定义

语义缓存(Semantic Cache)指把历史问答以向量形式存储,新请求按语义相似度命中后直接返回历史答案、省去重复推理的机制,对高频重复类问题是最立竿见影的降本手段。

展开

它的风险边界在「相似不等于相同」:两个问题向量距离近,答案却可能南辕北辙——「报销上限多少」与「报销下限多少」在向量空间里几乎重合,错误命中不会报错,只会静默返回错答案,这类事故靠日志回放才能追到。交付纪律三条:相似度阈值用客户真实流量回放校准,不套用通用值;命中内容带失效机制,知识库更新时旧缓存按版本作废,否则时效类问题全中招;高风险决策域默认不开缓存,或仅缓存明确脱敏的通用问答。与向量数据库的辨析:两者共用嵌入技术,但目标不同——向量数据库为生成检索证据,语义缓存为跳过生成复用答案,阈值策略与评测口径应分开管理。启用决策要把命中率预估与错误命中风险一起向客户摆明,缓存省的钱与可能赔的信任要放在同一张账上。

参见

智能体专题评测回归模式FDE 实战指南