模型在「故意变笨」:用世界知识换取推理能力的交易
来源:w4g1.dev — 2026-08-17
📋 概述
作者观察到数学与代码基准一路飙升,而纯事实回忆(SimpleQA)却惨不忍睹——小模型幻觉率高达 80% 以上。这是刻意为之的交易:实验室在用「世界知识」换取「推理能力」。推理是可压缩的少量过程,蒸馏与 RL 能高效迁移;而事实会腐烂,且训练一次成本极高。于是知识被搬到运行时——检索、工具调用、文档——模型只负责推理。这让幻觉从「不可定位的权重错误」变成「可检查、可修正的数据 Bug」,也让端侧 20-40B 模型成为现实。
🔑 核心要点
- 参数被拿去换 推理能力:math/code 基准暴涨,而 SimpleQA 事实回忆仅 53%、小模型幻觉率 80%+。
- 事实占空间(约每参数 2 比特),且会过期腐烂;过程不腐烂,因此推理被优先保留。
- 知识被搬到 harness:检索、工具、web search、文档在运行时喂给模型。
- 幻觉由此从「权重里无法 grep 的错误」变成「可定位、可编辑、可写回归测试的数据 Bug」。
- 推理所需活跃参数约 13B,剥离知识后总尺寸趋近活跃尺寸,20-40B 4-bit 模型可上消费级显卡。
- 未来模型卡或不再列出知识截止日期,世界状态在运行时注入,如同 CPU 拿到程序。
💡 金句
当知识住在模型外,错误答案就有了地址:它引用文档,你就能打开文档去核对、去修正。
👍 0
👎 0
← 返回 Lobsters 首页