作者构建了 AgentSelfEdit,一个会依据执行反馈重写自己系统提示词的开源旁车程序,用 A/B 测试并只提升统计上被证明有效的编辑。结果它看起来在正常工作,其实没有——单次会话里他发现并修掉了 31 个问题,其中 9 个是根本性的,每一个都让系统看似正常实则失灵。最危险的是提升门槛放行了噪声:代码写成 p < 0.95 而非 p < 0.05,几乎什么都通过,p=0.1 的「提升」有 10% 概率只是随机噪声,两行代码的差别就是一个会学习的系统与一个会漂移的系统。其余还包括 A/B 测试把提示词跟它自己比、评分器接受任何非空响应、Docker 测试跳过难点、失败痕迹被伪造、CLI 连的是 mock 而非真实 LLM、配置静默忽略端点。