dev.to | 📄 原文链接 | 2026-09-07 收录

当你的基准终于开始说真话:先把基准修好再优化模型

来源:dev.to — 2026-09-06

📋 概述

作者发布 CauterRule(把 agent 反复失败提炼成常设规则的开源 sidecar)并公开了 v0.1.0 现场测试报告。早期数字糟到几乎可以写成「本地 OMLX 模型太弱」的故事,但反复跑数据后得出的正确结论恰恰相反:是基准 harness 自己在制造相当一部分失败。修复解析器、提示词、结果重置与时间戳四个问题后,同一批基准的 golden 语料从 3/11 解析成功跳到 10/10,raw 语料从 0/10 到全通——早期基准在 golden 语料上丢掉了 73% 的信号,它测的根本不是模型质量而是解析器脆弱性。

🔑 核心要点

💡 金句

一个坏基准产生的可信结果,比没有结果更糟——没有结果逼你去调查,而坏基准的可信结果给你虚假的信心。
← 返回 dev.to 首页