dev.to | 📄 原文链接 | 2026-08-25 收录

模型考了 30 分,测试框架考了 100 分——你评测的到底是哪个?

来源:dev.to — 2026-08-24

📋 概述

同一款 Claude Opus 5 模型,在 ARC 官方框架下只有 30.16%,换成 NVIDIA 的 AVO 框架却达到 100%,权重没变、变的只是外层的代码。作者通过对比五个框架发现,官方框架会丢弃每步后的推理并滚动截断上下文,等于每步都在「擦掉模型的记忆」;而满分框架则是靠记忆、监督和行动预算这些补偿层替模型「兜底」。文章指出,基准分数本身已经失去可溯源来源,一个不带框架版本、记忆状态和行动预算的分数,本质上只是自报成绩。微软更把训练框架直接塞进强化学习循环,让框架本身变成权重的一部分。

🔑 核心要点

💡 金句

一个不带框架版本、记忆状态和行动预算附件的基准分数,本质上只是自报成绩。
← 返回 dev.to 首页