从 J 空间提取“转向向量”:用概念 token 直接给模型摆方向
来源:darshanmakwana412.github.io — darshanmakwana412.github.io · 47 分 · by martianvoid
📋 概述
作者受 Jacobian 空间(J space,把 LLM 中间激活“言语化”以便解读它将要说什么)的启发,想验证能否反着用 J lens:不再从激活倒推语义,而是仅凭与某概念相关的几个 token,就推导出通用激活转向向量(steering vector)。实验用已发布 J lens 的 Qwen3-1.7B 在本地跑,结果发现对“全大写输出”“用怪腔调说话”这类简单行为,从概念 token 推出的转向向量效果相当好;但对无法用几个词清楚表达的复杂行为,该方法的向量容易产生幻觉、表现脆弱。代码以 jlens_steer 公开。
🔑 核心要点
- 思路是“反用 J lens”:从概念 token 归纳通用转向向量,而非从激活推语义。
- 实验在 Qwen3-1.7B 上开展,该模型已有社区发布的 J lens(neuronpedia/jacobian-lens)。
- 对全大写输出等简单行为,概念 token 推出的向量成效显著。
- 对无法用几个词清晰表达的复杂行为,所得向量易幻觉、偏脆弱。
- 代码已公开于 jlens_steer 仓库。
💡 金句
对能用一两个 token 说清的行为它很好用,可一旦行为复杂到没法用几个词表达,这个办法就会露出脆弱的本质。
👍 0
👎 0
← 返回 Hacker News 首页