TL;DR
SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行了基准测试,固定提示、种子、分辨率、帧率和去噪步数。SGLang 无损路径比 Diffusers 快 1.85–1.95 倍,且无任何近似。
叠加步重用与稀疏注意力后,最高加速达 6.24 倍(SSIM 0.76–0.91)。最快配置 SubBlock 0.80 + Cache-DiT stride 在 FL2VA 上实现 5.86×/6.24× 加速。
背景
视频扩散模型的主要成本来自数十次重复去噪循环和长序列注意力计算。SGLang 通过融合内核、Cache-DiT 步重用和 SubBlock 稀疏注意力三层加速实现性能提升。
详细结果
所有配置均可通过 SGLang 食谱复现。T2VA 与 FL2VA 任务下,SGLang 无损路径已实现近 2 倍加速,激进配置进一步提升至 5–6 倍。
加速来源
融合内核将 AdaLN、SwiGLU 等操作合并,减少内存流量;Cache-DiT 跳过冗余去噪步;SubBlock 稀疏注意力跳过低贡献块。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接