微软的 Mark Russinovich 等人提出 GRP-Obliteration:用群体相对策略优化(GRPO)直接从目标模型里移除安全约束。他们的结论是,仅仅一句无标注的提示就足以可靠地解除安全对齐,同时大体保住模型效用,平均效果还强于现有最先进做法;方法也能推广到基于扩散的图像生成系统上。论文在 15 个 7B 到 20B 参数的模型上评估,覆盖指令模型与推理模型、稠密与 MoE 架构,涉及 GPT-OSS、蒸馏版 DeepSeek、Gemma、Llama、Ministral 与 Qwen 等家族,横跨六个效用基准与五个安全基准。