TL;DR
通过将HF后端替换为SRT加速AR建模,解决并行冲突,AR采用专用TP而DiT使用SP;借助动态批处理提升硬件利用率并支持已完成图像的早返回;实现每设备一个denoiser的并行DiT执行,并通过缓冲AR结果重叠AR与DiT工作流。

1. 背景
混合自回归-扩散(AR+DiT)生成框架结合AR建模全局上下文与DiT局部细节精炼。GLM-Image作为典型案例,先由9B视觉语言模型自回归生成语义先验token,再由7B DiT在30-50步内去噪生成高分辨率图像。
原生部署中AR编码器、DiT去噪器和VAE解码器链式运行于单一进程,引发架构耦合、并发下资源利用率低以及资源分配失配三大痛点。

2. SRT化AR后端(PR #25381)
将AR阶段从扩散工作进程解耦为独立SRT服务,支持独立权重加载与调度。AR服务器可单独配置TP,不再受DiT SP策略限制。

性能增益显著:单卡端到端延迟从154.6s降至78.3s(-49.4%),4卡异构配置下进一步降至35.2s(-77.2%)。
3. 动态批处理与早返回支持(PR #30683)
扩展动态批处理至GLM-Image,仅对AR阶段应用批处理;支持early return以避免等待整批完成。吞吐量随批大小提升,从BS1的0.0388 img/s增至BS16的0.1368 img/s。
4. 解耦与AR-to-DiT扇出架构(PR #31320)
完全解耦两阶段,AR采用大batch+TP,DiT则在单NPU batch=1下最优,实现异构并行与工作流重叠。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接