dev.to | 📄 原文链接 | 2026-09-17 收录

当 AI 的能力长过了我们用来衡量它的测试

来源:dev.to — 2026-09-14

📋 概述

作者借 GPT-6 Astra 的发布与「AGI 已到」的说法,提出一个容易被跳过的问题:我们究竟怎么知道一个模型在变得更好。基准测试有用但也会老化——有的饱和、有的只是难以直接测量能力的代理指标、标注与评测方法本身也在变,所以分数并不自动说明这个模型对你的工作有多有用。

🔑 核心要点

💡 金句

一个基准分数并不会自动告诉你,这个模型对你自己的工作到底有多有用。
← 返回 dev.to 首页