模型架构
Qwen3.8-2.4T-A95B 延续 Qwen3.5/3.6 系列的混合注意力设计,总参数达 2.4T,每 token 激活 95B 参数,共有 92 层。

其亮点包括 69 个 GDN 线性注意力层与 23 个 GQA 全注意力层按 3:1 交替排列,以及 512 专家的 MoE 层(top-10 路由)。
核心特性支持
每个请求需同时维护 KV cache、GDN 循环状态与卷积窗口。SGLang 通过 ReplaySSM 机制解决 MTP 验证时的状态恢复问题,仅记录输入而非快照状态,实现零开销前缀缓存与推测解码。
Prefill-Decode 解耦
PD 解耦通过类型化状态注册表传输 KV cache、GDN 状态及卷积窗口,支持不同并行布局,并借助 staging buffer 实现 chunk 级重叠传输。
Chunked 流水线并行 Prefill
纯 PP prefill 将 92 层切分到各 stage,chunk 间反向流动实现 hand-off 与 compute 重叠,大幅优于 Wide EP。
性能表现
在 8K 输入/1K 输出场景下,NVFP4 checkpoint 于 TP8 B300 上 MTP 解码达 346 tok/s,DSpark 达 378 tok/s;PD 解耦后每 GPU 总吞吐最高达 5126 tok/s。
Day-0 RL 支持
Miles 实现原生 NVFP4 LoRA RL,与 BF16 Megatron 训练器共享 64 张 GB300,GSM8K GRPO 实验验证奖励稳定、KL 曲线平坦。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接