编码智能体越来越擅长「完成任务」:改文件、修错误、写测试、跑命令,然后以一句「所有测试通过 ✅」收尾,我们大多数人就此翻篇。作者提出的问题是:那个智能体真的运行了它声称通过的测试吗?听起来显而易见,其实不是。在 AI 辅助开发里,我们正在开始相信总结而不是证据。一句「测试通过」只是一个声明,它不告诉你跑了什么命令、是否跑了完整测试集、有没有测试被跳过、命令是否真的以成功退出、输出来自哪一版代码,甚至有没有真的运行。作者认为这是一类新的信任问题:你和真实验证之间,多了一层可能出错的环节。