Qwen3.8-Flash-Next:SGLang 实现 Day-0 支持

Qwen3.8-Flash-Next:SGLang 实现 Day-0 支持

引言

今日,Qwen团队开源了Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。它在Qwen4中的角色,类似于Qwen3-Next在Qwen3.5中的定位。从Qwen3.5到Qwen3.8,均采用了Gated DeltaNet + Gated Attention混合设计。SGLang与Qwen、NVIDIA及AMD团队合作,为该模型提供Day-0支持。

Qwen3.8-Flash-Next在架构上进行了多项升级,包括GDN + QSA混合注意力、Gated Residual以及N-gram Embedding等。

模型架构

该模型主干为125B参数,额外51B N-gram Embedding,每token激活6B参数,共48层(36层GDN线性注意力 + 12层QSA稀疏注意力),MoE层使用512专家并top-10路由。SGLang支持N-gram Embedding主机内存卸载、异步预取,以及FlashInfer优化的Gated Residual算子。

Qwen3.8-Flash-Next Architecture

Qwen Sparse Attention:粗检索与精注意力

Qwen3.8-Flash-Next采用压缩比为4的QSA。每个QSA层包含轻量索引器选择关注位置,以及稀疏GQA读取选中K/V缓存。索引器对压缩块打分,保留最佳512块,最终注意力仅处理约2051个token位置,大幅降低长上下文计算与内存开销。

QSA index and attention data flow in SGLang.

IndexShare MTP与HyperConnection优化

IndexShare MTP复用QSA索引选择,推测解码时将draft indexer调用从N次降为1次。在TP4 B200上,NVFP4量化checkpoint配合MTP可达540 tok/s接受长度3.3。HyperConnection通过Mix/Combine算子实现四分支残差流,内核级加速达2.05倍。

PLE dataflow and SGLang

完整启动命令与配置指南请参阅SGLang Cookbook。

本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!