返回全部文章
RAG 与知识库

RAG 知识切分:决定回答质量的第一道关卡

切分粒度错了,检索再好也白搭。知识切分是 RAG 里最值得花时间的工程环节。

2026-07-283 分钟阅读RAG知识切分语义检索

切分为什么重要

向量检索比的是「语义相似」,但模型生成需要「完整上下文」。切得太碎,单个片段信息不完整;切得太粗,检索命中里混入大量无关内容。

切分的本质,是找到「既语义完整、又边界清晰」的信息单元。

三种常见策略

固定长度切分实现简单,但经常把一句话腰斩。按段落和标题切分更符合文档结构,适合问答类知识。结构化数据(表格、FAQ、字段说明)应该单独建模,而不是硬塞进文本块。

实践中通常混合使用:正文按语义块切,标题作为上下文附加到每个块。

  • 固定长度:实现快,但语义断裂风险高
  • 结构切分:按标题、段落、列表切,保留上下文
  • 结构化存储:FAQ、表格、字段单独索引

给片段补上下文

每个片段可以附加文档标题、章节路径和元数据。检索时先按元数据过滤,再按语义排序,命中质量会明显提升。

例如「退货政策」下的每个片段都带上「退货政策」这个章节名,模型就更容易理解语境。

用真实问题验证切分

拿 50-100 个真实用户问题测试:每个问题的正确答案分布在哪个片段里?如果答案被切断,调整切分策略;如果检索不到,检查元数据和嵌入效果。

切分不是一次定稿,而是随知识类型持续调整的工程。

一份文档的切分示例

以退货政策为例:先按「适用条件、操作步骤、退款时效、特殊情况」切成四个语义块,每个块附带「退货政策」章节元数据;再把常见问法单独存成 FAQ 结构。

这样用户问「退款多久到账」时,系统能精准命中退款时效块,而不是拉回整篇政策。

多格式文档的处理

PDF、表格、PPT、视频字幕各有各的结构,直接全部转成纯文本会丢失关键信息。表格要保留行列关系,PPT 要按页保留标题层级,视频要按时间轴切分。

格式复杂时,先按来源类型建立不同的预处理管线,再统一进入向量库,而不是用一套通用流程硬切所有文件。

多格式处理的价值在于召回质量:格式保留得越好,模型越能理解上下文。

检索结果的质量排序

向量相似度不是唯一排序依据。可以叠加元数据权重:文档更新时间越新权重越高、权威来源权重高于转载、与用户权限匹配的结果优先。

排序策略要写清楚优先级,并用真实问题验证调整效果,而不是凭感觉加权重。

好的排序让正确答案稳定出现在前三,比追求单个指标更实际。

参考资料

NEXT

有类似的项目想法?

从一次免费的想法梳理开始,把 AI 想法变成可验证、可上线的产品。

预约沟通看看作品
KEEP READING

继续阅读

2026-08-04RAG 与知识库

什么是 RAG,什么时候才需要它

RAG 不是万能的记忆增强方案。它的适用条件是:知识会变、需要追溯、数据私有。

阅读全文
2026-07-21RAG 与知识库

RAG 评测:召回与回答质量要分开看

RAG 的质量问题一半出在检索,一半出在生成。混在一起评测,永远找不到根因。

阅读全文