dev.to | 📄 原文链接 | 2026-09-14 收录

评论区替我设计了下一次实验,然后逼我先把预测冻结

来源:dev.to — 2026-09-13

📋 概述

作者此前发表了一篇关于 AI 安全扫描器谄媚失效的文章,读者在四天内指出实验缺少对照组、要求他在跑实验之前先公开预注册预测、修正了统计方法,还顺手写了一份生产监控规范。新的实验沿用同样的 200 个代码切片但去掉「扫描器已标记」的提示,用两次运行的差值把「相信标记的谄媚」和「到处报漏洞的过度报告」两种解释分开。预测、协议与判定规则都在第一次 API 调用之前公开冻结。

🔑 核心要点

💡 金句

先把预测写下来,并和结果一起发布,因为数字一旦出现,两个故事都能同样好地解释它,人就会很自然地挑那个更合身的。
← 返回 dev.to 首页