SGLang-JAX 在 TPU 上优化 Ling-2.6-1T:单 Pallas 内核隐藏 MoE 数据移动

SGLang-JAX 现已支持 inclusionAI 的 Ling-2.6-1T 在 TPU v7x 上高效部署。通过分析发现 Mixture-of-Experts(MoE)路径是主要瓶颈。全新 Fused MoE V2 内核将 scatter、expert FFN 与 gather 融合,并重叠计算与数据搬运。实测显示 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(下降 53%),16 块 TPU v7x 的 decode 输出吞吐达到 16 张 H200 的 1.29×–1.77×。本文详述内核设计、性能数据与端到端收益。

LMSYS MoE 优化 TPU 推理
392

SGLang 中 Waterfill 与 LPLB 优化 DeepEP MoE 负载均衡

本文介绍 SGLang 中针对 DeepEP MoE 推理的两种调度时负载均衡方案:Waterfill 和 LPLB。Waterfill 通过将共享专家动态分配给负载较低的 rank,在 DeepSeek-V3/R1 类工作负载下吞吐提升 1.48%-4.66%,DeepSeek V4 最高达 +4.92%。LPLB 利用线性规划对冗余专家副本进行负载感知分发,吞吐提升 0.84%-7.34%。两项技术均已在 SGLang PR 中落地,显著缓解专家路由不均导致的 rank 等待问题。

LMSYS MoE SGLang
492