SGLang 实现 NVIDIA Nemotron 3.5 Lightning 零日支持

SGLang 实现 NVIDIA Nemotron 3.5 Lightning 零日支持

SGLang 团队宣布对 NVIDIA Nemotron 3.5 Lightning 模型提供零日支持。该模型专为始终在线的代理场景打造,可在本地系统、边缘、数据中心及云端高效运行。

Nemotron 3.5 Lightning 核心特性

  • 架构:混合专家(MoE)架构
  • 参数规模:总参数 30B,激活参数仅 3B
  • 上下文长度:最高支持 100 万 token
  • 支持推测解码:多令牌预测(MTP)、DFlash、DSpark
  • 模态:文本输入与输出
  • 部署平台:DGX Spark、RTX、Jetson、H100/H200、B200 等

通过 SGLang 快速部署

SGLang 提供高性能推理运行时,支持连续批处理、前缀缓存和 OpenAI 兼容 API。以下是使用 BF16 检查点的启动命令:

docker run --rm -it --gpus all lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

启动后可通过 OpenAI 客户端发送请求,并通过 enable_thinking 参数灵活控制每步推理开关。

推测解码优化推理

模型内置三种推测解码技术:MTP 使用轻量预测头前瞻多个 token;DFlash 采用扩散式草稿模型并行生成候选块;DSpark 则结合自回归与扩散优势,在 DGX Spark 上表现最佳。

效率基准表现

Nemotron 3.5 Lightning 在保持高准确率的同时显著提升吞吐量。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

如图所示,Nemotron 3.5 Lightning 在 PinchBench 上以相当准确率完成任务的速度比 Qwen3.6-35B 快约 30%,远超 Gemma 4 26B,处于效率前沿。

本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!