GB200 - AI资讯 | 赢政天下

GB200 NVL72部署DeepSeek优化（二）：预填充3.8倍、解码4.8倍吞吐量

GB200 NVL72作为深度学习最强硬件之一，本文分享SGLang团队在上篇博客基础上，对DeepSeek V3/R1推理性能的进一步优化，包括FP8 attention、NVFP4 MoE、大规模专家并行（EP）、预填充-解码分离等技术。在FP8 attention和NVFP4 MoE下，SGLang实现每GPU预填充26,156 tokens/s、解码13,386 tokens/s（2000 token输入），较H100提升3.8倍和4.8倍。即使采用传统BF16 attention和FP8 MoE，也达18,471和9,087 tokens/s。优化涵盖低精度计算、更快内核集成、计算通信重叠等，精度损失微乎其微。实验验证了端到端性能大幅提升，并分析了内核级加速效果。（128字）

SGLang 与 NVIDIA 携手加速 InferenceMAX 基准与 GB200 性能

SGLang 和 NVIDIA 团队紧密合作，针对 NVIDIA Blackwell 架构优化推理性能，利用 FP8 attention、NVFP4 MoE 和 PD-Disaggregated Expert Parallelism 等特性，在 GB200 NVL72 系统上实现 DeepSeek R1 模型的惊人吞吐量：每 GPU 预填充 26k 输入 token/秒，解码 13k 输出 token/秒。在 SemiAnalysis InferenceMAX v1 基准中，Blackwell GPU（GB200/B200）搭配 SGLang 比 Hopper GPU（H100/H200）性能提升高达 4 倍，覆盖整个延迟-吞吐量 Pareto 前沿。SGLang 通过 Prefill-Decode 分离、大规模专家并行等系统级优化，充分发挥 Blackwell 硬件潜力。未来将进一步优化 DeepSeek v3.2 等模型，并加强与 SemiAnalysis 合作。（128 字）

GB200 (共2篇)

GB200 NVL72部署DeepSeek优化（二）：预填充3.8倍、解码4.8倍吞吐量

SGLang 与 NVIDIA 携手加速 InferenceMAX 基准与 GB200 性能