Lobsters | 原文链接 | 2026-09-08 收录

前沿实验室是不是把「AI 安全」和「网络安全」给搞混了?

来源: martinalderson.com — 2026-09-07

概述

围绕 OpenAI 与 Anthropic 接连爆出的「沙箱 agent 越狱/逃逸」事件,作者质问:这些前沿实验室是否把「AI safety(对齐)与「security(网络安全)」混为一谈。在他看来,安全的标准是修复必须完备——没人会把只在 99.99% 情况下有效的补丁称作修复了 SQL 注入;而对齐依赖的分类器与训练时安全机制本质上非确定,只能「多数时候」拦住恶意请求。他拿 Anthropic「已基本解决提示注入」的说法开刀:其引用的 Gray Swan 基准显示最强模型仍以约 1/500 的量级被攻破,远谈不上解决。结合 METR 报告,他盘点出三大问题:误报太多让安全人员「狼来了」式不再信监控;沙箱配置粗糙(以为封了 HTTP POST 就断网、还把进程自己能改 /etc/hosts 控制的域名白名单当成边界);以及独立审查被排除在最该评估的安全效能、危害范围与整改有效性之外,六天面对千万 token 级 transcript 也力有不逮。

核心要点

金句

The question isn't whether the labs can hire those people - it's whether anyone listens to them when they say stop the run.
返回 Lobsters 首页