SGLang 团队宣布对 NVIDIA Nemotron 3.5 Lightning 模型提供零日支持。该模型专为始终在线的代理场景打造,可在本地系统、边缘、数据中心及云端高效运行。
Nemotron 3.5 Lightning 核心特性
- 架构:混合专家(MoE)架构
- 参数规模:总参数 30B,激活参数仅 3B
- 上下文长度:最高支持 100 万 token
- 支持推测解码:多令牌预测(MTP)、DFlash、DSpark
- 模态:文本输入与输出
- 部署平台:DGX Spark、RTX、Jetson、H100/H200、B200 等
通过 SGLang 快速部署
SGLang 提供高性能推理运行时,支持连续批处理、前缀缓存和 OpenAI 兼容 API。以下是使用 BF16 检查点的启动命令:
docker run --rm -it --gpus all lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16启动后可通过 OpenAI 客户端发送请求,并通过 enable_thinking 参数灵活控制每步推理开关。
推测解码优化推理
模型内置三种推测解码技术:MTP 使用轻量预测头前瞻多个 token;DFlash 采用扩散式草稿模型并行生成候选块;DSpark 则结合自回归与扩散优势,在 DGX Spark 上表现最佳。
效率基准表现
Nemotron 3.5 Lightning 在保持高准确率的同时显著提升吞吐量。

如图所示,Nemotron 3.5 Lightning 在 PinchBench 上以相当准确率完成任务的速度比 Qwen3.6-35B 快约 30%,远超 Gemma 4 26B,处于效率前沿。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接