代码编译通过、测试全部通过、PR 显示绿色,于是作者合并了它。几天后他在查看完全无关的东西时发现了问题:一处状态更新在技术上「按我要求的方式」完全正确,却悄悄破坏了整个系统依赖的某个假设。更新本身没问题,问题在于另一块状态本应随之改变,而这两者之间的关系从他所编辑的函数里根本看不出来。测试覆盖了被更新的状态,却没覆盖二者之间的关系。什么都没崩溃、没有测试失败、包括他在内的评审者当时都没发现。真正可怕的不在于 AI 写了代码,而在于每一个他惯常信任的信号都在告诉他代码是正确的——这恰恰与风险应有的逻辑背道而驰。