HN | 📄 原文链接 | 2026-07-14 收录

4-Bitter 教训:NVFP4 RL 的稳定性与性能

来源:humansand.ai — 2026-07-13

📋 概述

humans& 团队与 RadixArk、NVIDIA 合作,发布了首个 开源 NVFP4 4-bit 强化学习训练方案,在保持 BF16 训练精度的同时大幅提升吞吐量。文章系统阐述了三项关键优化:(1) 去量化反向传播——让反向传播感知前向量化决策,消除梯度尖峰;(2) 4/6 自适应缩放——在 4 和 6 之间选择最优 FP4 最大值,减少量化误差;(3) 选择性层精度——MoE 共享专家和最后 15% 层保持 BF16。三者叠加后,梯度稳定性与 BF16 基线无差异,奖励曲线紧密跟踪。该方案在 NVIDIA Rubin GPU 上可达到 BF16 的 9 倍运算吞吐,所有实现已在 TransformerEngine、FlashInfer 和 SGLang 中开源。

🔑 核心要点

💡 金句

把 32 位精度压缩到 4 位,还要在强化学习的不稳定性中保持收敛——这是反向传播与量化误差之间的精确和解。
← 返回 HN 首页