METR 调整开发者生产力实验设计
来源:metr.org — 2026-07-18
METR 发布更新称,由于 AI 工具在开源开发者中的广泛采用,其第二轮开发者生产力实验出现了显著的选择效应,导致数据信号不可靠。研究团队发现,越来越多开发者因不愿在无 AI 条件下工作而退出或筛选任务,这使得当前估算更可能低估 AI 的真实加速效果。为此,METR 正在重新设计实验方案,并探索观察数据、问卷和固定任务实验等替代测量手段。
核心要点
- 早期研究显示 AI 使任务耗时增加 19%,而新实验对原开发者子集的估算转为 -18% 的加速。
- 实验面临的主要问题是 选择效应:高 AI 依赖倾向的开发者更可能拒绝参与。
- 开发者还会 筛选提交任务,避开那些他们认为没有 AI 就难以完成的任务。
- 报酬从 150 美元/小时降至 50 美元/小时,以及多智能体并行使用时间难以统计,进一步影响数据质量。
- 为改进测量,METR 计划尝试更密集的实验、观察性数据、问卷、固定任务实验以及开发者层面随机化等方案。
- 研究团队认为,真实 AI 加速效果可能远高于当前估算,但现有数据只能提供 微弱的证据。
“my head’s going to explode if I try to do too much the old fashioned way because it’s like trying to get across the city walking when all of a sudden I was more used to taking an Uber.”