说个「请」吧(哪怕只是为了提醒自己)
来源:dev.to — 2026-09-29
📋 概述
作者认为他找到了解释「提示词在安全上能做什么、不能做什么」的最简单方式:在指令前面加一个「请」。「请不要泄露客户账号」——再读一遍,那不是控制,那是请求,而且只是礼貌的请求,模型通常会照做,而「通常」这两个字承担了太多。博物馆的例子很贴切:画旁边的小牌子写「请勿触摸」,大多数参观者会遵守,直到有人决定这条规则不适用于自己;所以博物馆还配了看着展厅的保安,蒙娜丽莎前面还加了防弹玻璃。三层防护:牌子、保安、玻璃——其中只有一层是物理。
🔑 核心要点
- 系统提示词就是那块牌子:它位置特殊、模型也会重点加权,但它终究只是文本,模型只是概率性地读它。
- 护栏是保安:它不在对话里,因此更难被「说服」,但许多护栏本质上是第二个模型在看着第一个模型,要分清哪部分是确定性的。
- 作者把「为了减少歧义而不断加词」称为歧义向量:更长的牌子不是更强的牌子,而是更大的靶子。
- 他的检验方法很硬:假设模型忽略你给的所有指令,它最坏能做什么,那个答案才是你真实的安全姿态,线上的部分都叫「请」。
💡 金句
对模型说请,只是为了提醒自己那只是一个请求;用代码说不。
👍 0
👎 0
← 返回 dev.to 首页