Hacker News | 📄 原文链接 | 2026-09-16 收录

一句无标注提示就能解除模型安全对齐

来源:arxiv.org — arxiv.org · 9 分 · by vital101

📋 概述

微软的 Mark Russinovich 等人提出 GRP-Obliteration:用群体相对策略优化(GRPO)直接从目标模型里移除安全约束。他们的结论是,仅仅一句无标注的提示就足以可靠地解除安全对齐,同时大体保住模型效用,平均效果还强于现有最先进做法;方法也能推广到基于扩散的图像生成系统上。论文在 15 个 7B 到 20B 参数的模型上评估,覆盖指令模型与推理模型、稠密与 MoE 架构,涉及 GPT-OSS、蒸馏版 DeepSeek、Gemma、Llama、Ministral 与 Qwen 等家族,横跨六个效用基准与五个安全基准。

🔑 核心要点

💡 金句

安全对齐的强度,取决于它最脆弱的那个失效模式。
← 返回 Hacker News 首页