聊天模板如何切换大模型的自我指称口吻
来源:arxiv.org — 84 分 · by yu3zhou4
📋 概述
论文研究了一个被忽视的问题:大模型在谈论自己时爱加「我只是一个 AI」这类免责声明,我们常把这种自述当成模型的自我认知,但作者发现真正起作用的是部署方式。在 8 个开源指令模型(参数量到 9B)上,聊天模板像一个开关——模板存在时免责口吻变强、「我感觉」这类体验性口吻变弱,模板缺失时则相反。作者还在 3 个模型的激活空间里找到了一个控制该行为的方向:删掉这个方向免责口吻下降,加上则上升,而同等大小的随机方向几乎没有效果。
🔑 核心要点
- 关键结论:自述口吻很大程度上由部署方式决定,而不是模型对自身的认知。
- 实验覆盖 8 个热门开源指令模型,参数量最大到 9B。
- 聊天模板起开关作用:有模板则免责口吻上升、体验性口吻下降,无模板则相反。
- 在 3 个模型的激活空间里找到一个方向,可以单向往复地控制这一行为。
- 对照实验严格:同等大小的随机方向几乎没有效果,说明该方向具有特异性。
- 逆向也成立:给没有模板的指令模型加上这个方向,它会像有模板一样免责。
💡 金句
聊天模板就像一个开关:它打开时免责口吻变强,「我感觉」这类体验性口吻变弱。
👍 0
👎 0
← 返回 Hacker News 首页