当 LLM 裁判意见一致,我们该相信吗?
来源:amazon.science — amazon.science · 6 分 · by Betelbuddy
📋 概述
用多个 LLM 当裁判投票是常见做法,但文章指出关键问题不是有几位裁判同意,而是它们是否独立地同意:如果多数裁判共享提示词模板、训练谱系或模型家族,一致可能只是同一个错误的重复,票数会让证据看起来比实际更强。作者提出用 Ising 模型做依赖感知的标签聚合,把裁判面板当成网络来建模成对依赖,从而区分独立证据与共同盲点,在相关分类、毒性检测与摘要评估三个任务的十裁判面板上比加权多数投票提升 9% 到 14% 的准确率。
🔑 核心要点
- 一致票数会高估证据强度。
- 核心是区分独立证据与共同盲点。
- 用 Ising 模型为裁判面板建模成对依赖。
- 三个任务上准确率提升 9%-14%。
- 建议统计评估面板多样性并报告相关性校正后的置信度。
💡 金句
八个裁判说相关,只有在它们彼此独立时才算一项强证据,否则只是同一个错误被重复了八遍。
👍 0
👎 0
← 返回 Hacker News 首页