作者的一个关键判断是:AI 写的代码通常不是错的,而是不完整的——能编译、主路径能跑、演示很干净,缺的是无聊的那 20%:没人验证过的依赖、跑在前置条件之前的一步、纸面上存在却什么都没回滚的 rollback。这些认识来自他做 Agent 系统的实测:跑过 170 个 Agent 目标,看着规划器可预测地重复同三类规划缺陷;让 83 个真实 Agent 穿过一道工具调用关卡;还花一周修匹配器,结果 Bug 只是评估器里的六行。文中每一条都是他现在做成关卡而非指南的东西——指南是希望,关卡是会让构建失败的测试。