Hacker News | 📄 原文链接 | 2026-09-15 收录

当 LLM 裁判意见一致,我们该相信吗?

来源:amazon.science — amazon.science · 6 分 · by Betelbuddy

📋 概述

用多个 LLM 当裁判投票是常见做法,但文章指出关键问题不是有几位裁判同意,而是它们是否独立地同意:如果多数裁判共享提示词模板、训练谱系或模型家族,一致可能只是同一个错误的重复,票数会让证据看起来比实际更强。作者提出用 Ising 模型做依赖感知的标签聚合,把裁判面板当成网络来建模成对依赖,从而区分独立证据与共同盲点,在相关分类、毒性检测与摘要评估三个任务的十裁判面板上比加权多数投票提升 9% 到 14% 的准确率。

🔑 核心要点

💡 金句

八个裁判说相关,只有在它们彼此独立时才算一项强证据,否则只是同一个错误被重复了八遍。
← 返回 Hacker News 首页