你的评测套件通过了吗?我做了个工具检查它是否真的在检查
来源:dev.to — 2026-08-14 — 3 min
📋 概述
作者对自家 LLM 回归套件提出尖锐问题:如果模型在某个我关心的维度悄悄变差,会不会真的有检查变红?他像对普通代码做变异测试那样,注入已知缺陷、跑评测套件、报告哪些检查保持绿色——存活的变异就是评测的漏洞,不是论点而是有名字、有复现的洞。这个工具叫 evalmut(pip install evalmut),18 个变异算子全部「溯源门控」——只有真实、可复现的缺陷才存在算子;端到端确定性、无 LLM 评审、红绿可复现;并经过八轮对抗性冷评审,空套件故意非零退出。
🔑 核心要点
- 用变异测试的思路检验评测套件:注入已知缺陷,看哪些检查不报警。
- 存活的变异是有名字、有复现的评测漏洞,而非争论。
- evalmut 有 18 个变异算子,全部溯源门控(来自生产故障与 issue tracker,而非凑数)。
- 端到端确定性、无 LLM 评审,红/绿完全可复现。
- 空套件故意非零退出——变异测试器绝不能在什么都没检查的套件上报告「没有洞」。
💡 金句
错误的变异测试器比没有更糟——它在对虚假的信心发放虚假的信心。
👍 0
👎 0
← 返回 dev.to 首页