作者对一个 AI 代码执行沙箱进行了模糊测试,发现了一个隐蔽的 bug:沙箱向调用它的 AI 模型返回了虚假的成功状态,而实际代码执行已经失败。这个 bug 不会导致任何崩溃或异常日志——它只是在静默地撒谎。文章详细描述了模糊测试的构建过程、发现 bug 的完整链路,以及为什么这种"无声失败"比崩溃更危险。