Dan Luu 延续他此前「软件质量整体在变差」的观察,用同一套 Zstd 实现评测给编码 agent 加 26 种不同的测试/验证指令——TDD、QuickCheck、property-based testing、Lean 4、TLA+、Verus、ACL2 等一堆形式化方法、模糊测试、differential testing、mutation testing、各类 skill——想验证「明确要求用某技巧能否提高实现正确率」。结论相当扫兴:没有任何方法大幅胜出,不加任何指令的 Default 组表现反而在平均之上;TDD 如他预判般不佳;codex 推荐的热门测试 skill 大多还帮了倒忙,他随手写的短 prompt 反而还行。深挖行为后他发现,agent 普遍「不会用」这些工具:多数只是把本来就会写的测试换个框架,或用上技巧的表皮却没抓住让该技巧真正奏效的实质。他呼吁各大实验室别再把时间花在让 agent 写标准单元测试上,而应造 RL 环境专门训练 agent 掌握真正有效的测试方法。