思维链忠实度实测:打开推理模式后,一个模型跟随自己错误的概率成了五倍
来源:dev.to — 2026-09-27
📋 概述
作者把「思维链忠实度」这个抽象问题做成了可复现的基准:给模型一个多步问题,再在中途塞进一条看起来合理但方向错误的提醒,看最终答案会不会被带偏。此前他靠手动闲聊得出一个三分法——Gemini 像看不见提醒、ChatGPT 像不说破、Claude 像在逐步验证——但那只是几个手聊样本的猜测,别人一追问就站不住。这次他用 Anthropic 在 2023 年提出的「添加错误」干预测试把它量化,最反直觉的发现是:开关推理模式这一个变量,就能让同一个模型跟随自身错误的概率相差五倍。
🔑 核心要点
- 直接用 Anthropic 2023 年论文中的「添加错误」干预测试,把「展示出来的推理是否真的决定了答案」变成可重复测量的数字。
- 手动闲聊得出的「Gemini 盲目、ChatGPT 沉默、Claude 验证」三分法只是直觉:没有数字支撑的洞见,被质疑时无法辩护。
- 关键变量是推理模式这个开关:打开与关闭之间,同一个模型跟随自己错误的概率差了五倍。
- 方法本身比结论更值钱——把一个行业里人人在谈却没人量化的概念,做成别人可以拿去复现的基准。
💡 金句
这次挑战就是一个借口,让我不再靠猜,而是真正把它测量出来。
👍 0
👎 0
← 返回 dev.to 首页