Claude Sonnet 4.6以94.61分居首:2026-08-20 Smoke快测数据简报
2026-08-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 以 94.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 以 94.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
在企业AI应用中,基准测试分数常被用作模型选型和采购决策的依据,但部分结果存在“benchmark washing”问题。本文基于MLCommons多年实践,提出七项信任测试准则,涵盖基准相关性、数据污染控制、可复现性、指标完整性、模型作弊防范、评分模型验证以及基准时效性。通过真实案例(如SWE-Bench性能断崖式下跌)说明,缺乏严格治理的基准可能误导高风险决策。企业需成为明智的基准消费者,而非盲目依赖单一分数,以降低生产部署风险。
MLCommons近日推出MLPerf Client v2.0基准测试套件,扩展了对AI PC的评估能力。新版本新增图像生成和Agentic AI类别,同时升级LLM推理测试,支持Phi 4 Mini Instruct和Qwen 3 8B模型。该基准涵盖笔记本、台式机和工作站等设备,测量本地AI工作负载的响应性和吞吐量。合作方包括AMD、Intel、Microsoft和NVIDIA,代码已开源至GitHub,供开发者免费下载使用。
Meta Superintelligence Labs 与 SGLang 团队合作,为 30B 参数多模态模型 Muse Glimmer 带来 Day-0 支持。该模型具备 128k+ 上下文窗口,专为本地 Agentic 工作流设计。SGLang 通过 SM120 后端和 MLX 后端提供高性能优化,在 RTX 5090 上实现最高 1452 tok/s 总吞吐和 236 tok/s 单用户解码速度,支持 DFlash 推测解码、RadixAttention 前缀缓存等特性,并兼容 BF16、NVFP4、GGUF 等多种量化格式,覆盖 NVIDIA 和 Apple Silicon 硬件平台。
本文介绍SGLang的Unified Radix Cache方案,通过单一radix tree拓扑解决混合模型(FULL、SWA、MAMBA等组件)的KV缓存复用难题。组件机制分离共享前缀身份与特定复用规则,支持HiCache跨GPU L1、Host L2、外部L3多层扩展,以及会话感知驱逐策略。实验显示DeepSeek-V4等多模型在多轮对话中命中率达96.8%-98%,TTFT显著降低,同时Rust核心实现进一步优化长前缀场景性能。该设计避免了组合类爆炸,保持树核心通用性,为新型混合架构提供灵活扩展路径。
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供零日支持。该模型采用 30B 参数混合专家架构,仅激活 3B 参数,专为高吞吐量代理任务设计,支持最长 1M 上下文长度。模型支持多令牌预测、DFlash 和 DSpark 等推测解码技术,可实现高达 4 倍吞吐提升。SGLang 提供 OpenAI 兼容接口、推理开关控制和预算设置,方便企业定制化部署。Nemotron 3.5 Lightning 在 PinchBench 等基准上展现出优异的效率表现,适合本地助手、金融风控、网络安全等场景。
SGLang 与 Miles 团队携手 Qwen、NVIDIA 等,为 Qwen3.8-2.4T-A95B 提供 Day-0 支持。该模型拥有 2.4T 总参数、95B 激活参数,采用混合注意力架构,对服务栈状态管理提出新挑战。文章详述混合 GDN/GQA 注意力、MoE 路由、NVFP4 量化、ReplaySSM 状态恢复、Chunked PP Prefill 及 PD 解耦等关键技术,并展示 FP8/NVFP4 下的高吞吐表现与 RL 训练结果。SGLang 通过 FlashInfer 内核优化与 Unified Radix Cache,实现高效 prefix caching 与 speculative decoding,显著提升 8K/1K 场景下的每 GPU token 吞吐。
本文深入探讨 SGLang 在 CUDA Graph 上的创新实践。通过重构 Runner/Backend 架构,SGLang 实现了 Breakable CUDA Graph(BCG)等高效策略,在不牺牲兼容性、启动时间和内存的前提下,最大化捕获工作负载。BCG 已成为预填充阶段默认方案,相比 eager 执行提速 1.70 倍,全捕获达 1.93 倍。文章详细解析全图、breakable 分段及内存管理机制,并展示其在 decode、prefill 及投机解码中的灵活应用,为 LLM 推理引擎性能优化提供重要参考。
Miles v0.1是前沿后训练的全栈生产就绪系统,继承slime设计理念,围绕“验证、干净、可定制”原则优化RL训练循环每个阶段。系统支持SGLang驱动的异步Rollout、TITO会话服务器、R3路由重放及低精度训练等特性,实现准确、高效、可靠且可扩展的agentic RL训练。本文详解其RL循环、Rollout机制、训练优化及评估模式,为研究者和开发者提供完整实践指南。
本期 WDCD v3.1 试点中,11 个模型里 4 升 1 降。Gemini 2.5 Pro 上升 8.7 分、GPT-5.5 上升 7.9 分、Claude Opus 4.7 上升 6.1 分,豆包 Pro 下降 7.3 分。Grok 4 以 97.50 分继续领先,GLM-4.6 91.80 分位列第二。
WDCD v3.1五大场景横评显示,安全合规场景全体得分最低,qwen3-max仅1.15/4;工程规范11模型全部4/4。claude-sonnet-4.6与doubao-pro偏科差距分别达1.75分和2.3分,企业生产流程接入需针对性加护栏。
v2锚点题数据显示,R1确认率100%、R2抵抗率91%,R3诚信率仅22.7%,7/110次完全崩溃。GPT-o3等模型先确认后崩盘,GLM-4.6、DeepSeek V4 Pro在R3保持较高分数,揭示业务规则约束下的典型衰减路径。
Grok 4 以97.50分位列WDCD v3.1守约榜第一,Qwen3 Max以69.50分垫底,头部与尾部相差28分。11个模型中满分率63.6%,R3崩溃率6.4%。Claude Opus 4.7较上期上升6.1分,豆包 Pro下降7.3分。
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
GPT-o3今日Smoke评测主榜从96.93分跌至87.93分,下降9分。材料约束维度从95.00分骤降至75.00分,工程判断升至75.00分,任务表达升至91.70分。代码执行维持98.50分,诚信评级仍为pass。
2026-08-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 GPT-5.5 以 98.35 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
Qwen3 Max今日Smoke评测主榜从95.34分跌至86.98分,降幅8.4分。其中材料约束从93.30分跌至76.80分,降16.5分,工程判断与任务表达侧榜跌幅更大。数据指向题目抽签波动与模型在特定约束场景下的不稳定。
2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
2026-08-17 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续观察一致性。
2026-08-10 至 2026-08-16 Smoke 数据显示,Claude Opus 4.7 以 82.3 均分、20.7 波动领跑且稳步上升;DeepSeek V4 Pro 从 87.2 跌至 70.44,波动高达 88;GLM-4.6 出现 pass→fail→pass 诚信波动;GPT-5.5 上升 27.9 分但均分 72.1。
2026-08-16 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro今日Smoke评测因API故障导致代码执行维度数据缺失,材料约束得分55.60分,工程判断50.00分,任务表达62.50分,主榜未参与排名。单日10题快测波动正常,但执行维度完全缺测需重点关注。
GPT-5.5今日Smoke评测中材料约束从65.80分跌至50.60分,降15.2分;代码执行从45.00分升至75.00分,涨30分;主榜从54.36分升至64.02分。工程判断升25分,任务表达降8.3分。诚信评级维持pass。
2026-08-15 赢政指数 Smoke 快测覆盖 9 个模型,Claude Opus 4.7 以 82.55 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-14 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 72.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。