RAG 文档入库流水线:从原文到可检索 chunk
梳理文档入库流水线的关键步骤:解析、清洗、切块、元数据、向量化和回归检查。
RAG 质量很大一部分取决于入库流水线。模型回答不好,可能不是模型问题,而是原文解析失败、chunk 边界糟糕、元数据缺失或旧数据没有清理。
LlamaIndex 文档把数据加载、索引和检索组织成完整流程,OpenAI embeddings 文档说明文本可以转成向量用于搜索。[ingest-001][ingest-002]
入库分六步
- 读取原文。
- 去掉导航、脚注和重复模板。
- 按标题层级切块。
- 写入 slug、标题、heading、日期等元数据。
- 生成 embedding。
- 抽样检查召回。
RAG 入库不是 ETL 的附属步骤,它本身就是知识系统的质量入口。
概念记录:
{
"source_id": "post-001",
"chunk_id": "post-001#h2-usage#02",
"metadata": { "heading": "使用方式", "date": "2026-07-14" }
}每次入库都要能回滚
保留文档版本和 chunk 版本,才能在检索质量下降时定位是哪次入库改变了结果。
综合这些资料可以推断:好的 RAG 系统不是一次性建库,而是持续维护的内容索引工程。
参考资料
- [ingest-001] LlamaIndex Docs, “Loading data”, https://docs.llamaindex.ai/en/stable/module_guides/loading/
- [ingest-002] OpenAI Developers, “Embeddings”, https://developers.openai.com/api/docs/guides/embeddings