从 LLM API 窃取推理轨迹:攻击如何运作、该审计什么
来源:dev.to — 2026-08-14 — 7 min
📋 概述
ELLIS 图宾根研究所、马普智能系统研究所与 Snyk 的研究论文指出:Anthropic、OpenAI、Google 返回给 API 客户端的加密推理块并非看起来那么安全。作者把前沿模型产出的推理块重放给同厂商更弱的模型、破解弱模型,再用两次 API 调用即可明文恢复强模型的隐藏推理。根因在于设计:提供商不把思维链存服务器端,而是作为加密文本块返回给客户端、随下次请求再传回,且该块在同一厂商生态内跨会话、跨模型、跨用户完全可交换。论文在 120 道 Codeforces 题上验证了提取保真度,解码推理与厂商报告的隐藏思考 token 数在 y=x 对角线上高度吻合。
🔑 核心要点
- 加密推理块并非保护:可跨会话、跨用户、跨模型重放,设计上就具备可移植性。
- 攻击用两次 API 调用:从强模型拿源推理块,让同厂商更弱的模型转写明文。
- 攻击从不直接接触强模型,也不会触发强模型上的防蒸馏保护。
- 论文在 120 道 Codeforces 题上验证:解码推理与隐藏思考 token 数沿 y=x 高度吻合。
- 真正的风险面:你的会话日志、agent 追踪与工具调用历史变成了自己不知道的解密面。
💡 金句
真正要紧的不是越狱,而是你的会话日志、agent 追踪和工具调用历史,如今成了你未曾知晓的解密面。
👍 0
👎 0
← 返回 dev.to 首页