Lobsters | 原文链接 | 2026-09-08 收录

让 agent 用测试技巧真能提升正确率吗?Dan Luu 的 26 组对照实测给出了扫兴答案

来源: danluu.com — 2026-09-07

概述

Dan Luu 延续他此前「软件质量整体在变差」的观察,用同一套 Zstd 实现评测给编码 agent 加 26 种不同的测试/验证指令——TDD、QuickCheck、property-based testing、Lean 4、TLA+、Verus、ACL2 等一堆形式化方法、模糊测试、differential testing、mutation testing、各类 skill——想验证「明确要求用某技巧能否提高实现正确率」。结论相当扫兴:没有任何方法大幅胜出,不加任何指令的 Default 组表现反而在平均之上;TDD 如他预判般不佳;codex 推荐的热门测试 skill 大多还帮了倒忙,他随手写的短 prompt 反而还行。深挖行为后他发现,agent 普遍「不会用」这些工具:多数只是把本来就会写的测试换个框架,或用上技巧的表皮却没抓住让该技巧真正奏效的实质。他呼吁各大实验室别再把时间花在让 agent 写标准单元测试上,而应造 RL 环境专门训练 agent 掌握真正有效的测试方法。

核心要点

金句

Agents are really bad at testing and don't seem to understand how to test reasonably "by default".
返回 Lobsters 首页