Hacker News | 📄 原文链接 | 2026-09-09 收录

从 J 空间提取“转向向量”:用概念 token 直接给模型摆方向

来源:darshanmakwana412.github.io — darshanmakwana412.github.io · 47 分 · by martianvoid

📋 概述

作者受 Jacobian 空间(J space,把 LLM 中间激活“言语化”以便解读它将要说什么)的启发,想验证能否反着用 J lens:不再从激活倒推语义,而是仅凭与某概念相关的几个 token,就推导出通用激活转向向量(steering vector)。实验用已发布 J lens 的 Qwen3-1.7B 在本地跑,结果发现对“全大写输出”“用怪腔调说话”这类简单行为,从概念 token 推出的转向向量效果相当好;但对无法用几个词清楚表达的复杂行为,该方法的向量容易产生幻觉、表现脆弱。代码以 jlens_steer 公开。

🔑 核心要点

💡 金句

对能用一两个 token 说清的行为它很好用,可一旦行为复杂到没法用几个词表达,这个办法就会露出脆弱的本质。
← 返回 Hacker News 首页