引言
在低精度RL中,rollout、训练、checkpoint转换和实时权重更新必须遵循统一的精度契约,否则采样器与训练器策略会发散。Miles与SGLang RL生态已集成低精度方案,本文进一步将MXFP8与NVFP4扩展至Blackwell原生格式。
为何需要Blackwell原生方案?
以往低精度方法并非针对MXFP8或NVFP4设计。现有Miles路径采用DeepSeek-V3风格的块缩放FP8方案,在Blackwell上其FP32 scale仍通过软件而非原生微缩放硬件实现。NVFP4则可充分利用B200/B300的FP4 Tensor Core吞吐优势。
格式背景
MXFP8
MXFP8是Blackwell原生微缩放FP8格式,每个32个E4M3值共享一个E8M0局部scale。
NVFP4
NVFP4采用两级缩放:FP32张量级scale与E4M3块级scale。

方案一:端到端MXFP8 RL
该方案在rollout、前向传播、权重梯度与数据梯度GEMM中全程使用MXFP8,选定张量可保留BF16。

方案二:MoE专家Per-Token NVFP4 RL
NVFP4更激进,仅对MoE专家进行量化,其余部分默认BF16。





高精度层保护
保留最终层BF16可显著改善训练稳定性。


© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接