SGLang-JAX 在 TPU 上优化 Ling-2.6-1T:单 Pallas 内核隐藏 MoE 数据移动
SGLang-JAX 现已支持 inclusionAI 的 Ling-2.6-1T 在 TPU v7x 上高效部署。通过分析发现 Mixture-of-Experts(MoE)路径是主要瓶颈。全新 Fused MoE V2 内核将 scatter、expert FFN 与 gather 融合,并重叠计算与数据搬运。实测显示 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(下降 53%),16 块 TPU v7x 的 decode 输出吞吐达到 16 张 H200 的 1.29×–1.77×。本文详述内核设计、性能数据与端到端收益。