潜在推理模型容易解释吗?一项关于 LRM 可解释性的调查
来源:arxiv.org — 2026-04-06
📋 概述
这篇 COLM 2026 论文调查两个最先进的潜在推理模型(LRM)的可解释性。作者发现:逻辑推理数据集上 LRM 常常不需要潜在推理 token 就能给出同样答案,这或许解释了 LRM 为何不总能稳定优于显式推理方法;而当 token 确实必要且预测正确时,能解码出黄金推理痕迹的概率高达 65-93%;并提出了无需已知黄金痕迹即可解码并验证自然语言推理轨迹的方法。
🔑 核心要点
- 潜在推理 token 常常并非必要,LRM 无需它们也能给出相同答案。
- 当 token 必要且预测正确时,可解码黄金推理痕迹达 65-93%。
- 提出无需先验痕迹即可解码并验证自然语言推理轨迹的方法。
💡 金句
当前 LRM 在很大程度上编码了可解释的过程,而可解释性本身可以成为预测正确性的信号。
👍 0
👎 0
← 返回 Lobsters 首页