模型考了 30 分,测试框架考了 100 分——你评测的到底是哪个?
来源:dev.to — 2026-08-24
📋 概述
同一款 Claude Opus 5 模型,在 ARC 官方框架下只有 30.16%,换成 NVIDIA 的 AVO 框架却达到 100%,权重没变、变的只是外层的代码。作者通过对比五个框架发现,官方框架会丢弃每步后的推理并滚动截断上下文,等于每步都在「擦掉模型的记忆」;而满分框架则是靠记忆、监督和行动预算这些补偿层替模型「兜底」。文章指出,基准分数本身已经失去可溯源来源,一个不带框架版本、记忆状态和行动预算的分数,本质上只是自报成绩。微软更把训练框架直接塞进强化学习循环,让框架本身变成权重的一部分。
🔑 核心要点
- 同一模型在不同框架下差距可达 25-70 分,官方框架「为暴露模型而造」,满分框架「为兜底模型而造」。
- 官方框架逐条丢弃推理并滚动截断上下文,保留推理+压缩可让 OpenAI 模型从 13.3% 升到 38.3%。
- 记忆、监督、行动预算三大补偿组件是 70 分差距的主要来源。
- 微软 Agent Lightning 把部署期框架直接接入 RL 循环,奖励黑客防护成为训练的一部分。
- 真正的指标应是「每验证任务成本」,而非孤立看模型分数。
💡 金句
一个不带框架版本、记忆状态和行动预算附件的基准分数,本质上只是自报成绩。
👍 0
👎 0
← 返回 dev.to 首页