Moonshot AI 团队发布 Kimi Linear 论文,提出一种新型线性注意力机制,在保持与标准 Softmax Attention 相近表达能力的同时,将长序列推理的计算复杂度从 O(n²) 降至 O(n)。该架构是 Kimi K3 模型长上下文能力的核心技术支撑,通过精心设计的核函数和归一化策略,解决了传统线性注意力在语言建模中表达能力不足的问题。
🔑 核心要点
Kimi Linear 的核心创新在于 「表达性线性化」:通过引入可学习的特征映射(而非固定的随机投影),在 O(n) 复杂度下逼近 Softmax Attention 的行为。
与传统线性注意力(如 Performer、Linear Transformer)不同,Kimi Linear 在 中短序列上几乎无损,不会出现在短文本上显著劣于标准注意力的退化问题。