RAG 不是 AI 问题——它是戴着 AI 帽子的数据工程问题
来源:dev.to/cyclopt_dimitrisk
📋 概述
每个 RAG 教程都走同样的路:加载文档→切块→嵌入向量库→接检索→问问题→得到答案。二十分钟,看起来很棒。但一到真实数据、真实用户、真实规模,AI 部分反而是最容易的,教程跳过的一切才是难点。文档更新、过期、删除——向量库里躺着同一份政策文档的三个版本的嵌入;表格被切在不同块里——表头在一、数据在二、二者分开都无用;法律条文引用了"上述条件"但"上述"在前一个块里。这不是 AI 问题,这是搜索引擎解决了几十年的数据生命周期和切分策略问题。
🔑 核心要点
- 教程跳过 文档生命周期管理:需要同步管线跟踪文档状态、使过期嵌入失效、处理部分更新。
- 切分策略决定一切:默认按 token 切分在真实文档上以可预测的方式失败——表格、交叉引用、长距离依赖。
- 不完整的检索结果导致 模型自信回答基于不完整信息,用户也无从知晓——直到有人手动核对发现错误。
- 删除源文档不会 自动删除向量库中的对应块——这是搜索引擎级别的数据一致性问题。
💡 金句
The AI part of RAG was the easy part. The hard part is everything the tutorial skipped.
← 返回 Dev.to 首页