dev.to | 📄 原文链接 | 2026-08-15 收录

你的评测套件通过了吗?我做了个工具检查它是否真的在检查

来源:dev.to — 2026-08-14 — 3 min

📋 概述

作者对自家 LLM 回归套件提出尖锐问题:如果模型在某个我关心的维度悄悄变差,会不会真的有检查变红?他像对普通代码做变异测试那样,注入已知缺陷、跑评测套件、报告哪些检查保持绿色——存活的变异就是评测的漏洞,不是论点而是有名字、有复现的洞。这个工具叫 evalmut(pip install evalmut),18 个变异算子全部「溯源门控」——只有真实、可复现的缺陷才存在算子;端到端确定性、无 LLM 评审、红绿可复现;并经过八轮对抗性冷评审,空套件故意非零退出。

🔑 核心要点

💡 金句

错误的变异测试器比没有更糟——它在对虚假的信心发放虚假的信心。
← 返回 dev.to 首页