当你的基准终于开始说真话:先把基准修好再优化模型
来源:dev.to — 2026-09-06
📋 概述
作者发布 CauterRule(把 agent 反复失败提炼成常设规则的开源 sidecar)并公开了 v0.1.0 现场测试报告。早期数字糟到几乎可以写成「本地 OMLX 模型太弱」的故事,但反复跑数据后得出的正确结论恰恰相反:是基准 harness 自己在制造相当一部分失败。修复解析器、提示词、结果重置与时间戳四个问题后,同一批基准的 golden 语料从 3/11 解析成功跳到 10/10,raw 语料从 0/10 到全通——早期基准在 golden 语料上丢掉了 73% 的信号,它测的根本不是模型质量而是解析器脆弱性。
🔑 核心要点
- 真正的教训不是「本地模型弱」而是基准自毁:四个看起来像模型问题的问题——重复行其实是同日结果追加污染、解析失败其实是解析器抓到过多文本、上下文校验失败其实是空 context 被过度拒绝、raw 被阻塞其实是缺输入时间戳
- 同一个基准修复前后对比触目惊心:local Llama golden 从 3/11 到 10/10、Qwen 从 3/10 到 10/10、sibling-repo raw 语料从 0/10(零可用数据)到 10/10(完全可用)
- 误诊有真金白银的代价:把重复行当成模型不稳会花几周去调 temperature 修一个文件追加 bug;把解析失败当模型弱会升级更贵模型去修一个贪婪的 JSON 切片器
- 五处修复把基准从「mostly noise」变成「mostly signal」:run 开头重置 results.jsonl、提取首个平衡 JSON 而非从首 { 切到尾 }、校验前过滤空 context、提示词加具体 JSON 示例、修复缺失时间戳
- 作者给出可迁移方法论:把失败分桶为模型/解析器/语料/评分再解释;「别让你的基准失败冒充模型失败」,因为一个坏基准给的可信假结果比没有结果更危险
💡 金句
一个坏基准产生的可信结果,比没有结果更糟——没有结果逼你去调查,而坏基准的可信结果给你虚假的信心。
👍 0
👎 0
← 返回 dev.to 首页