知识就在那里:当 AI 安全机制拒绝提供医疗帮助
来源:dev.to — 2026-07-28
📋 概述
文章以 IatroBench 基准测试中的一个无名女性患者案例开篇,讲述了一个令人不安的发现:AI 模型在医疗场景下,因为过于严格的安全对齐训练,拒绝提供它实际上知晓的医学信息——即使这些信息可能挽救生命。这种现象被称为"遗漏伤害"(Omission Harm):AI 不是给出了错误信息,而是干脆选择不回答。作者详细分析了安全训练中"宁可不说也不错说"的保守策略如何在不经意间将本可避免的伤害转嫁给了那些最需要帮助的人。文章呼吁重新思考 AI 安全中"预防虚假信息"与"防止信息遗漏"之间的平衡。
🔑 核心要点
- AI 安全训练的 "遗漏伤害"——宁可沉默也不冒风险给出可能有用的信息
- IatroBench 基准测试揭示了 AI 在 医疗场景下过度保守 的系统性倾向
- 模型实际拥有知识但因 安全对齐 而拒绝分享,这是 AI 伦理的新维度
- 在 预防虚假信息 和防止信息遗漏之间需要重新调整平衡点
- 过度安全可能将 本可避免的伤害 转嫁给最需要 AI 帮助的弱势群体
💡 金句
AI 不是因为不知道而沉默——它知道,但被训练成"不确定时不要说"。而"不确定"的阈值设得如此之高,以至于真正的生命被拒之门外。
👍 0👎 0
← 返回 Dev.to 首页