Hacker News | 📄 原文链接 | 2026-09-28 收录

聊天模板如何切换大模型的自我指称口吻

来源:arxiv.org — 84 分 · by yu3zhou4

📋 概述

论文研究了一个被忽视的问题:大模型在谈论自己时爱加「我只是一个 AI」这类免责声明,我们常把这种自述当成模型的自我认知,但作者发现真正起作用的是部署方式。在 8 个开源指令模型(参数量到 9B)上,聊天模板像一个开关——模板存在时免责口吻变强、「我感觉」这类体验性口吻变弱,模板缺失时则相反。作者还在 3 个模型的激活空间里找到了一个控制该行为的方向:删掉这个方向免责口吻下降,加上则上升,而同等大小的随机方向几乎没有效果。

🔑 核心要点

💡 金句

聊天模板就像一个开关:它打开时免责口吻变强,「我感觉」这类体验性口吻变弱。
← 返回 Hacker News 首页