SGL-Diffusion中AR+DiT全栈性能优化

SGL-Diffusion中AR+DiT全栈性能优化

TL;DR

通过将HF后端替换为SRT加速AR建模,解决并行冲突,AR采用专用TP而DiT使用SP;借助动态批处理提升硬件利用率并支持已完成图像的早返回;实现每设备一个denoiser的并行DiT执行,并通过缓冲AR结果重叠AR与DiT工作流。

performance result

1. 背景

混合自回归-扩散(AR+DiT)生成框架结合AR建模全局上下文与DiT局部细节精炼。GLM-Image作为典型案例,先由9B视觉语言模型自回归生成语义先验token,再由7B DiT在30-50步内去噪生成高分辨率图像。

原生部署中AR编码器、DiT去噪器和VAE解码器链式运行于单一进程,引发架构耦合、并发下资源利用率低以及资源分配失配三大痛点。

the whole pipeline

2. SRT化AR后端(PR #25381)

将AR阶段从扩散工作进程解耦为独立SRT服务,支持独立权重加载与调度。AR服务器可单独配置TP,不再受DiT SP策略限制。

glm image AR

性能增益显著:单卡端到端延迟从154.6s降至78.3s(-49.4%),4卡异构配置下进一步降至35.2s(-77.2%)。

3. 动态批处理与早返回支持(PR #30683)

扩展动态批处理至GLM-Image,仅对AR阶段应用批处理;支持early return以避免等待整批完成。吞吐量随批大小提升,从BS1的0.0388 img/s增至BS16的0.1368 img/s。

4. 解耦与AR-to-DiT扇出架构(PR #31320)

完全解耦两阶段,AR采用大batch+TP,DiT则在单NPU batch=1下最优,实现异构并行与工作流重叠。

Disaggregated
本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!