那套诞生于 70 年代的 TF-IDF 数学,如何戳穿你上百万投入的 RAG 骗局
来源:dev.to — 2026-09-01
📋 概述
作者(葡萄牙语)指出 99% 的 AI 团队在把成千上万美元花在 embedding API 和高配向量数据库之前,忘了问一个残酷问题:我的 RAG 语义检索真的比 1972 年 Karen Spärck Jones 提出的 TF-IDF 统计算法更好吗?稠密 embedding 会把精确词条(协议号、错误码、专有名词)稀释进连续向量,而 TF-IDF/BM25 对精确词的存在毫不留情。因此应在 CI/CD 的评估套件里让向量检索与 TF-IDF 并行跑同一金标数据集,如果稠密检索的上下文精度与召回不优于基线,说明 RAG 存在结构性缺陷。文章还列举 TF-IDF 能暴露的三大问题:糟糕的 chunking、语义幻觉、以及为何需要混合检索加重排。
🔑 核心要点
- 99% 的 AI 团队在烧钱前没拿 RAG 与 1972 年的 TF-IDF 基线对比
- 稠密 embedding 会稀释精确词条(协议号、错误码、专有名词),而 TF-IDF 对精确词毫不留情
- 评估应在 CI/CD 中并行跑向量检索与 TF-IDF/BM25,若稠密检索不占优则说明 RAG 有结构性缺陷
- TF-IDF 能暴露坏 chunking、语义幻觉,以及为何最终需要向量+BM25 的混合检索加重排
- TF-IDF 无 GPU、无 token 成本、微秒级执行,是检验 AI 系统的低成本真相镜
💡 金句
如果你不拿 RAG 和 TF-IDF 对比,你就不是在搞工程,你只是在为抽象付高价。
👍 0
👎 0
← 返回 dev.to 首页