4-Bitter 教训:NVFP4 RL 的稳定性与性能
来源:humansand.ai — 2026-07-13
📋 概述
humans& 团队与 RadixArk、NVIDIA 合作,发布了首个 开源 NVFP4 4-bit 强化学习训练方案,在保持 BF16 训练精度的同时大幅提升吞吐量。文章系统阐述了三项关键优化:(1) 去量化反向传播——让反向传播感知前向量化决策,消除梯度尖峰;(2) 4/6 自适应缩放——在 4 和 6 之间选择最优 FP4 最大值,减少量化误差;(3) 选择性层精度——MoE 共享专家和最后 15% 层保持 BF16。三者叠加后,梯度稳定性与 BF16 基线无差异,奖励曲线紧密跟踪。该方案在 NVIDIA Rubin GPU 上可达到 BF16 的 9 倍运算吞吐,所有实现已在 TransformerEngine、FlashInfer 和 SGLang 中开源。
🔑 核心要点
- 首个开源 4-bit RL 训练方案:NVFP4 同时量化权重和激活值,不依赖校准步骤
- 去量化反向传播(Dequantized Backward):反向传播使用前向的实际量化值,消除链式法则不一致
- 4/6 自适应缩放:在 FP4 的 4 和 6 最大值间按块选择误差更小的方案,量化匹配率超 99.97%
- 逐 token 激活缩放:避免未来 token 泄露到过去,无需离线校准
- 硬件效率:NVIDIA Rubin GPU 上 FP4 可达 35 PFLOPS,约为 BF16 的 9 倍
- 全栈开源:TransformerEngine + FlashInfer + SGLang 均已合并相关 PR,且 4/6 实现跨训练和推理 bit-exact 一致
💡 金句
把 32 位精度压缩到 4 位,还要在强化学习的不稳定性中保持收敛——这是反向传播与量化误差之间的精确和解。
← 返回 HN 首页