
1. 引言
DeepSeek-V4-Pro是一款拥有1.6万亿参数的MoE模型,同时提供FP8与FP4权重。此类大规模模型天然适合NVIDIA Blackwell GPU,但H20 GPU仍广泛部署,尽管缺少原生FP4 Tensor Core等优势。
硬件限制并未降低服务要求。长上下文预填充仍需控制TTFT,交互式解码需满足各服务层级的TPOT目标。
一个模型需要多种服务配置。工作负载特征、SLO与硬件行为共同决定部署拓扑。
2. 从硬件约束到服务配置
2.1 硬件约束与角色分配
2.2 容量选择
采用Humming MXFP4AFP8减少权重占用,Online C128扩展KV容量。
2.3 场景化服务配置
在batch size 1下,H20-141GB达到271 output tokens/s,优化后预填充吞吐达8.45k input tokens/s,1M-token提示处理仅需43.7秒。高吞吐解码配置下每节点达4.67k output tokens/s。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接