作者指出大多数 AI 第二意见在开始前就已崩塌:第二个模型往往先看到第一个模型的框架、假设与结论,因此系统看起来像评审,实则结构性偏向附和。他构建了开源的 AdversarialDebate,让两个 LLM 先各自独立评审同一产物,再逐点辩论。在 70 个真实 PR、411 场辩论、总成本仅 $0.53 的实地测试中,独立性确实重要,而不同意往往比强行一致更有用。