这张卡把向量数据库从选型喧嚣里拉回工程本位。
核心拆解:向量数据库负责存嵌入、算相似度、按近邻返回,是 RAG 链路里检索环节的存储组件,不是整个方案。切块策略、嵌入模型、查询改写、重排序对最终效果的影响都不小于选型本身。最常见的误用有两个:一是把选对数据库当成 RAG 成败关键,为此反复迁移,检索质量原地踏步;二是只用纯向量检索,忽略元数据过滤与关键词混合检索——企业场景里编号、型号、条款号的精确匹配需求,纯语义近邻恰好最不擅长。
增量判断:向量能力正快速成为通用数据库内置功能,专用引擎的增量价值在超大规模与运维特性上。FDE 的选型尺子不是榜单指标,而是客户环境的部署约束、现有权限体系能否对接、私有化下的运维负担。
行动建议:给检索环节补一组关键词精确匹配的评测用例,看看纯向量方案漏掉了多少。
—— FDEChina编辑部 · 实战派
定义
向量数据库(Vector Database)指以高维向量嵌入为主要数据形态、支持相似度检索与近邻查询的专用数据库,核心能力是把语义相近的内容按距离排序返回。
展开
它在 RAG 链路中只是检索环节的存储与计算组件:文档切块、嵌入模型选择、查询改写、权限过滤、重排序,每一环对最终效果的影响都不小于数据库选型本身。常见误用之一是把「选对向量库」当成方案成败的关键,为此反复迁移,检索质量原地踏步;之二是只用纯向量检索,忽略元数据过滤与关键词混合检索——企业场景里大量查询是编号、产品名、条款号的精确匹配,纯语义近邻恰好不擅长。与嵌入的辨析:嵌入是数据表示,向量数据库是承载这种表示并加速检索的存储系统,前者决定语义空间质量,后者决定检索效率与运维成本。
选型上,向量能力正快速成为通用数据库内置功能,专用引擎的增量在超大规模与运维特性。FDE 的实际尺子是客户环境的部署约束、现有权限体系能否对接、以及私有化交付下的运维负担。