你怎么知道你的 RAG 系统真的在工作?
来源:dev.to — 2026-07-24
📋 概述
以叔侄对话的形式,揭示了 RAG(检索增强生成)系统评估的盲区:开发者往往用十几个问题手动测试就觉得「看起来还行」。文章指出,检索失败、文档未命中才是 RAG 失败的真正元凶,而非模型或提示词问题。作者回顾了自己花了整整两天调试模型,最终发现是检索从未找到正确文档的经历。
🔑 核心要点
- 开发者常见误区:手动测试 15 个问题就觉得 RAG 系统「看起来还行」
- RAG 失败的真正元凶往往是 检索未命中,而非模型质量或提示词问题
- LLM 撒谎 vs 从未见过真相——「看起来还行」无法区分这两种情况
- 每次调整(换嵌入模型、改 chunk 大小、升级重排序器)都可能悄然破坏检索质量
- 正确的评估方法:量化检索命中率、答案忠实度、引用准确率,而非主观感觉
- 核心教训:不要调试错误的部分——先验证检索是否找到了正确文档
💡 金句
我花了整整两天调试那个聊天机器人,不断责怪模型和提示词。结果发现,以上都不是问题——检索从未在当前文档中找到正确的那一份。我花了两天调试错误的东西。
👍 0
👎 0
← 返回 Dev.to 首页