作者原本只会盯着 diff 流过屏幕,后来做了一个「第二个模型专门挑第一个模型毛病」的系统。第一次运行看起来完美:有断言、有逐条反驳、有干净结论,但看原始日志才发现第二个模型其实在复读预生成的文本,立场没有变化,也没有引用新证据——那是一场辩论的录音,不是辩论。他由此总结出几乎所有「AI 二次意见」的通病:只要模型 B 的上下文里出现模型 A 的结论,B 就被锚定了。
🔑 核心要点
第一次运行的辩论是假的:模型 B 在复读预生成文本,立场没变,也没引用新证据。
大多数所谓独立复核其实是验证而非独立判断,因为 B 的上下文里已经有 A 的结论,它只是在抵抗社交压力。