dev.to | 📄 原文链接 | 2026-09-18 收录

我用一个为三个模型设的阈值,评判了五个模型

来源:dev.to — 2026-09-17

📋 概述

作者在自己的基准测试里找缺失的 Bonferroni 校正,却发现了更糟的东西:唯一的显著性检验是一张临界值字典,只有 1、2、3 三个自由度,其余全部落到 `|| 5.991` 的兜底值。当模型数量变成 5,每个判定都在用一个为三个模型设定的门槛衡量。它只触发过一次、还恰好给出了正确答案——这正是最危险的 bug:错的方法给出对的结果,而输出无法告诉你哪一部分错了。

🔑 核心要点

💡 金句

一个只在有利于你的方向上出错的 bug,是你永远不会注意到的 bug:每次它触发,都在告诉你你想听的话。
← 返回 dev.to 首页