MiniMax-H3 在 8×H200 上实现 1.95 倍无损加速,最高达 6.24 倍

MiniMax-H3 在 8×H200 上实现 1.95 倍无损加速,最高达 6.24 倍

TL;DR

SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行了基准测试,固定提示、种子、分辨率、帧率和去噪步数。SGLang 无损路径比 Diffusers 快 1.85–1.95 倍,且无任何近似。

MiniMax-H3 H200 latency comparison

叠加步重用与稀疏注意力后,最高加速达 6.24 倍(SSIM 0.76–0.91)。最快配置 SubBlock 0.80 + Cache-DiT stride 在 FL2VA 上实现 5.86×/6.24× 加速。

MiniMax-H3 H200 speedup comparison

背景

视频扩散模型的主要成本来自数十次重复去噪循环和长序列注意力计算。SGLang 通过融合内核、Cache-DiT 步重用和 SubBlock 稀疏注意力三层加速实现性能提升。

MiniMax-H3 H200 speed–quality trade-off with highlighted profiles

详细结果

所有配置均可通过 SGLang 食谱复现。T2VA 与 FL2VA 任务下,SGLang 无损路径已实现近 2 倍加速,激进配置进一步提升至 5–6 倍。

Real 49-step MiniMax-H3 H200 execution traces

加速来源

融合内核将 AdaLN、SwiGLU 等操作合并,减少内存流量;Cache-DiT 跳过冗余去噪步;SubBlock 稀疏注意力跳过低贡献块。

MiniMax-H3 H200 fused-kernel speedupSubBlock score distributions and cutoff bands
本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!