我用一个为三个模型设的阈值,评判了五个模型
来源:dev.to — 2026-09-17
📋 概述
作者在自己的基准测试里找缺失的 Bonferroni 校正,却发现了更糟的东西:唯一的显著性检验是一张临界值字典,只有 1、2、3 三个自由度,其余全部落到 `|| 5.991` 的兜底值。当模型数量变成 5,每个判定都在用一个为三个模型设定的门槛衡量。它只触发过一次、还恰好给出了正确答案——这正是最危险的 bug:错的方法给出对的结果,而输出无法告诉你哪一部分错了。
🔑 核心要点
- 临界值表本身没错(3.841 / 5.991 / 7.815 对应 df 1/2/3),错的是那八个字符 `|| 5.991`:它把「我不知道」变成了一个自信的答案。
- 兜底阈值低于它所替代的每一个阈值,因此错误是单向的:只把噪声变成发现,从不埋没真实结果。
- 一个只在有利于你的方向上出错的 bug,你永远不会注意到。
- 11 个结果文件里只有一条落在缝隙中,用了错误门槛却得出正确结论(真实 p=0.001017)。
- 同一个函数还活在第二个 runner 里,说明这类缺陷会自我复制。
💡 金句
一个只在有利于你的方向上出错的 bug,是你永远不会注意到的 bug:每次它触发,都在告诉你你想听的话。
👍 0
👎 0
← 返回 dev.to 首页