返回文章列表

RAG 文档入库流水线:从原文到可检索 chunk

梳理文档入库流水线的关键步骤:解析、清洗、切块、元数据、向量化和回归检查。

RAG 质量很大一部分取决于入库流水线。模型回答不好,可能不是模型问题,而是原文解析失败、chunk 边界糟糕、元数据缺失或旧数据没有清理。

LlamaIndex 文档把数据加载、索引和检索组织成完整流程,OpenAI embeddings 文档说明文本可以转成向量用于搜索。[ingest-001][ingest-002]

入库分六步

  1. 读取原文。
  2. 去掉导航、脚注和重复模板。
  3. 按标题层级切块。
  4. 写入 slug、标题、heading、日期等元数据。
  5. 生成 embedding。
  6. 抽样检查召回。

RAG 入库不是 ETL 的附属步骤,它本身就是知识系统的质量入口。

概念记录:

{
  "source_id": "post-001",
  "chunk_id": "post-001#h2-usage#02",
  "metadata": { "heading": "使用方式", "date": "2026-07-14" }
}

每次入库都要能回滚

保留文档版本和 chunk 版本,才能在检索质量下降时定位是哪次入库改变了结果。

综合这些资料可以推断:好的 RAG 系统不是一次性建库,而是持续维护的内容索引工程。

参考资料

  1. [ingest-001] LlamaIndex Docs, “Loading data”, https://docs.llamaindex.ai/en/stable/module_guides/loading/
  2. [ingest-002] OpenAI Developers, “Embeddings”, https://developers.openai.com/api/docs/guides/embeddings