MLPerf Endpoints v0.7:AI推理基准奠基发布

MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints v0.7。该版本聚焦企业买家,强调当前性、全面性、可比性和洞察性,首批结果来自Coreweave、Google、Intel、KRAI和Nvidia等厂商。未来v1.0将引入更多买家导向规则、成本归一化及代理工作负载,支持滚动提交,助力采购决策。

MLC MLPerf AI基准测试
466

SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

SGLang 与 Miles 携手 Moonshot AI 和 NVIDIA,为 2.8 万亿参数的 Kimi K3 模型提供 Day-0 支持。该混合架构融合 KDA 线性注意力与 MLA,带来全新内存管理、统一内存池及 DSpark 推测解码等创新。单卡 decode 吞吐最高达 423 tok/s,prefill 阶段达每 GPU 2808 tok/s,同时支持 LoRA RL 训练。文章详解架构适配、状态管理及性能优化,助力开源大模型高效 serving。

LMSYS SGLang Kimi K3
468

迈向Blackwell原生8/4位RL:Miles端到端MXFP8与NVFP4实践

本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全链路精细精度控制,两种格式均可在保持训练-推理一致性的前提下大幅提升吞吐。实验显示,在Qwen3-30B-A3B的8x B200测试中,BF16与五种低精度配置的奖励曲线高度重合,而MXFP8与NVFP4显著缩短了rollout时间。文章详细对比了MXFP8与NVFP4的格式特性、反向传播模式选择,以及针对最终层和共享专家的BF16保护策略,为Blackwell时代高效RL训练提供了可落地的工程方案。

LMSYS Blackwell MXFP8
337

RadixArk 联手 Google:SGLang 全面功能落地 TPU

RadixArk 与 Google Cloud 达成合作,将 SGLang 推理框架引入 TPU 平台,为开发者提供硬件选择的灵活性。SGLang 已获超 3 万 GitHub 星标,支持 Gemma、Qwen 等主流模型及 Wan、Flux 等扩散模型。目前通过 SGL-JAX 即可在最新 TPU 上运行,年底还将推出 PyTorch 原生后端 SGL-torchtpu,实现数据并行、Radix Cache 等前沿特性。双方强调,此举消除迁移成本,让用户用相同 API 在 GPU 与 TPU 间无缝切换,打造开放、高性能的 AI 推理生态。

LMSYS SGLang TPU
229

SGLang 量化栈重构:打造更清晰架构

量化已成为高吞吐 LLM 服务不可或缺的核心技术。随着检查点格式、模型架构和硬件后端数量激增,量化栈维护难度不断上升。本文详细解析 SGLang 团队与 Ascend 团队提出的架构重构方案,将检查点解析、参数注册、权重加载、后处理与内核执行拆分为专注可复用的组件。新设计采用 Scheme-Based 架构,实现格式与硬件解耦,支持 AWQ、GPTQ 等多格式共享内核,提升开发效率与代码复用性。文中对比重构前后差异,并给出性能数据,展望 2026 下半年路线图,包括 W4A4、MXFP 等低比特方法扩展。重构将加速生产部署,降低耦合,为开发者与用户带来更一致体验。

LMSYS SGLang 量化优化
229