SGLang 实现 Muse Glimmer Day-0 支持,优化本地 Agentic 推理

SGLang 实现 Muse Glimmer Day-0 支持,优化本地 Agentic 推理

亮点概述

Muse Glimmer 是一款 30B 参数的多模态密集模型,拥有 128k+ token 上下文窗口,专为本地硬件上的端到端 Agentic 工作流打造。SGLang 提供专属优化,在 NVIDIA GeForce RTX 5090 上借助 NVFP4 与 DFlash 技术,实现最高 1452 tok/s 总输出吞吐和 236 tok/s 单用户解码速度。

Muse Glimmer 模型架构

Muse Glimmer 由 27.9B 密集文本解码器、1.9B ViT 以及 GELU 多模态投影器组成。文本解码器包含 52 层 Transformer,每层采用分组查询注意力(32 个查询头、2 个键值头)与 SwiGLU 前馈网络。解码器使用混合注意力模式,每四步交替三个 2048-token 滑动窗口层与一个全序列层,结合 RoPE 与 NoPE 实现上下文长度扩展。

功能支持

广泛硬件后端兼容

SGLang 支持 Muse Glimmer 部署于 Apple Silicon(Mac mini、M 系列 MacBook Pro)、NVIDIA RTX 5090、RTX PRO 6000 及 DGX Spark 等本地硬件。SM120 平台利用优化 GEMM 与 FlashInfer 后端,Apple Silicon 则通过原生 MLX 后端实现高性能服务。

DFlash 推测解码

用户可通过以下命令启用 DFlash 实现低延迟推理:--speculative-algorithm DFLASH

原生优化特性

模型兼容 SGLang 的低开销调度器、RadixAttention 前缀缓存及可中断 CUDA 图等优化,MLX 后端也已引入前缀缓存以提升 Apple Silicon 上的 Agentic 工作负载性能。

多格式检查点

提供 BF16、NVFP4(约 19.5GB)、GGUF Q4KM 等格式,适配不同硬件与精度需求。

性能测试结果

测试覆盖七个平台,批大小 1-8。DFlash 可将批大小 1 的交互性提升 1.9-4.3 倍,批大小 8 的总吞吐提升 1.4-4.2 倍。

  • RTX 5090 (nvfp4 + DFlash): 236.4 tok/s/user (batch 1), 1452 tok/s (batch 8)
  • B300 (nvfp4 + DFlash): 290.01 tok/s/user, 1295 tok/s
  • Apple M5 Pro (q4): 17.6 tok/s/user, 56.9 tok/s
本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!