SGLang 实现 Qwen3.8 模型 Day-0 支持

SGLang 实现 Qwen3.8 模型 Day-0 支持

模型架构

Qwen3.8-2.4T-A95B 延续 Qwen3.5/3.6 系列的混合注意力设计,总参数达 2.4T,每 token 激活 95B 参数,共有 92 层。

Qwen3.8-2.4T-A95B model architecture

其亮点包括 69 个 GDN 线性注意力层与 23 个 GQA 全注意力层按 3:1 交替排列,以及 512 专家的 MoE 层(top-10 路由)。

核心特性支持

每个请求需同时维护 KV cache、GDN 循环状态与卷积窗口。SGLang 通过 ReplaySSM 机制解决 MTP 验证时的状态恢复问题,仅记录输入而非快照状态,实现零开销前缀缓存与推测解码。

Prefill-Decode 解耦

PD 解耦通过类型化状态注册表传输 KV cache、GDN 状态及卷积窗口,支持不同并行布局,并借助 staging buffer 实现 chunk 级重叠传输。

Chunked 流水线并行 Prefill

纯 PP prefill 将 92 层切分到各 stage,chunk 间反向流动实现 hand-off 与 compute 重叠,大幅优于 Wide EP。

Chunked pipeline-parallel prefill: chunks flow through stages back to back, so each hand-off overlaps the next chunk

性能表现

在 8K 输入/1K 输出场景下,NVFP4 checkpoint 于 TP8 B300 上 MTP 解码达 346 tok/s,DSpark 达 378 tok/s;PD 解耦后每 GPU 总吞吐最高达 5126 tok/s。

Aggregate and PD-disaggregated serving results at 8,192 input and 1,024 output tokens for the FP8 and NVFP4 checkpoints, total tok/s per GPU against per-user output speed

Day-0 RL 支持

Miles 实现原生 NVFP4 LoRA RL,与 BF16 Megatron 训练器共享 64 张 GB300,GSM8K GRPO 实验验证奖励稳定、KL 曲线平坦。

Qwen3.8 LoRA RL on GSM8K: eval score, rollout reward, and train/rollout KL
本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!