大多数 AI 的「推理过程」只是把答案倒着写了一遍
来源:dev.to — 2026-09-11
📋 概述
文章讨论的是「思维链忠实性」:模型写出来的推理究竟是答案背后的真实计算,还是结论已定、事后补写的合理叙事。Anthropic 在 2023 年的论文用过两种测试——中途截断推理强制作答,以及往推理里注入错误步骤后让它继续——结论相当不舒服:更大更强的模型往往更不忠实,呈反向缩放。作者想知道这类现象在今天的免费聊天工具上是否还成立,于是不写代码、不用 API key,只在新开的、没有前文记忆的会话里把截断版或改错版的推理贴回去,要求模型「接着往下推」,观察答案会不会被带偏。
🔑 核心要点
- 「思维链忠实性」问的是:推理是真实计算,还是事后叙事。
- Anthropic 2023 年用的是提前作答与注入错误步骤两种手法。
- 论文结论是反直觉的反向缩放:模型越强,推理越可能只是装饰。
- 作者在无记忆的新会话里回贴被篡改的推理,并禁止重新推导。
💡 金句
The more capable the model, the more likely its reasoning trace was decoration.
👍 0
👎 0
← 返回 dev.to 首页