当 AI 的能力长过了我们用来衡量它的测试
来源:dev.to — 2026-09-14
📋 概述
作者借 GPT-6 Astra 的发布与「AGI 已到」的说法,提出一个容易被跳过的问题:我们究竟怎么知道一个模型在变得更好。基准测试有用但也会老化——有的饱和、有的只是难以直接测量能力的代理指标、标注与评测方法本身也在变,所以分数并不自动说明这个模型对你的工作有多有用。
🔑 核心要点
- 「模型能力强了很多」很容易滑向开发者不再被需要这类结论,但那是一个大得多的跳跃。
- 基准会老化:部分评测已经饱和甚至被考虑退役,新评测改用更真实或实验性的数据。
- 分数会变,有时只是因为测试本身改了,而不是模型变了。
- 写代码变便宜不会让软件工程消失,需求、架构、安全、验证、权衡与维护依然重要。
- 更有用的问题不是「AI 会不会改变工作」,而是我们有没有把 AI 测对。
💡 金句
一个基准分数并不会自动告诉你,这个模型对你自己的工作到底有多有用。
👍 0
👎 0
← 返回 dev.to 首页