Gemini 2.5 Pro以89.56分居首:2026-08-04 Smoke快测数据简报
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
2026-07-28至2026-08-02七天Smoke数据中,Qwen3 Max从59.28分升至96.1分,趋势+36.8;Gemini 3.1 Pro从100分跌至94.45分,趋势-5.6。Claude Opus 4.7与Gemini 2.5 Pro同样大幅上升,GPT-o3与GLM-4.6则出现下滑,高波动模型与诚信评级变化成为本周核心信号。
2026-08-02 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 96.7 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints v0.7。该版本聚焦企业买家,强调当前性、全面性、可比性和洞察性,首批结果来自Coreweave、Google、Intel、KRAI和Nvidia等厂商。未来v1.0将引入更多买家导向规则、成本归一化及代理工作负载,支持滚动提交,助力采购决策。
SGLang 与 Miles 携手 Moonshot AI 和 NVIDIA,为 2.8 万亿参数的 Kimi K3 模型提供 Day-0 支持。该混合架构融合 KDA 线性注意力与 MLA,带来全新内存管理、统一内存池及 DSpark 推测解码等创新。单卡 decode 吞吐最高达 423 tok/s,prefill 阶段达每 GPU 2808 tok/s,同时支持 LoRA RL 训练。文章详解架构适配、状态管理及性能优化,助力开源大模型高效 serving。
本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全链路精细精度控制,两种格式均可在保持训练-推理一致性的前提下大幅提升吞吐。实验显示,在Qwen3-30B-A3B的8x B200测试中,BF16与五种低精度配置的奖励曲线高度重合,而MXFP8与NVFP4显著缩短了rollout时间。文章详细对比了MXFP8与NVFP4的格式特性、反向传播模式选择,以及针对最终层和共享专家的BF16保护策略,为Blackwell时代高效RL训练提供了可落地的工程方案。
RadixArk 与 Google Cloud 达成合作,将 SGLang 推理框架引入 TPU 平台,为开发者提供硬件选择的灵活性。SGLang 已获超 3 万 GitHub 星标,支持 Gemma、Qwen 等主流模型及 Wan、Flux 等扩散模型。目前通过 SGL-JAX 即可在最新 TPU 上运行,年底还将推出 PyTorch 原生后端 SGL-torchtpu,实现数据并行、Radix Cache 等前沿特性。双方强调,此举消除迁移成本,让用户用相同 API 在 GPU 与 TPU 间无缝切换,打造开放、高性能的 AI 推理生态。
量化已成为高吞吐 LLM 服务不可或缺的核心技术。随着检查点格式、模型架构和硬件后端数量激增,量化栈维护难度不断上升。本文详细解析 SGLang 团队与 Ascend 团队提出的架构重构方案,将检查点解析、参数注册、权重加载、后处理与内核执行拆分为专注可复用的组件。新设计采用 Scheme-Based 架构,实现格式与硬件解耦,支持 AWQ、GPTQ 等多格式共享内核,提升开发效率与代码复用性。文中对比重构前后差异,并给出性能数据,展望 2026 下半年路线图,包括 W4A4、MXFP 等低比特方法扩展。重构将加速生产部署,降低耦合,为开发者与用户带来更一致体验。
今日Smoke评测中GLM-4.6材料约束从75.00降至47.70分,主榜却从46.29升至76.47分,代码执行从22.80升至100.00分,诚信评级从pass转为warn。单日10题快测下,维度剧烈波动值得关注。
GPT-o3在今日Smoke评测中主榜从93.16分跌至79.28分,暴跌13.9分。代码执行从95.00降至81.80,材料约束从90.90降至76.20,工程判断侧榜更跌30.6分至63.90。任务表达侧榜升至100.00。诚信评级维持pass。需判断是否为抽签波动还是真实退化。
2026-08-01 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Qwen3 Max 以 93.39 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中,Qwen3 Max材料约束从67.70跌至47.70,降幅20分;代码执行从54.70升至92.50,升37.8分。主榜从60.55升至72.34。工程判断降16.6分,任务表达升35分。诚信评级维持pass。单日10题抽签下,材料约束大幅波动值得追踪。
Grok 4今日Smoke评测代码执行从92.00分跌至72.50分,降19.5分;材料约束从60.90分升至84.10分,增23.2分;主榜从78.01分微降至77.72分。工程判断同步跌19.5分,任务表达升10分。单日10题快测下,需判断波动属性。
2026-07-31 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中,DeepSeek V4 Pro代码执行从100.00跌至75.00,主榜从83.53降至76.85。材料约束升至79.10,工程判断升至100.00,任务表达降至74.20,诚信评级从warn转为pass。单日10题快测下,此类波动需区分抽签与真实退化。
Grok 4今日Smoke评测主榜从89.30分跌至78.01分,降幅11.3分。其中材料约束从78.90分骤降至60.90分,代码执行从97.80分降至92.00分,工程判断则从81.90分升至94.50分。单日波动主要集中在材料约束维度,需观察是否为题目抽签所致。
2026-07-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 以 86.5 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1试点数据显示,Claude Opus 4.7与Sonnet 4.6分别上涨6.8分和6.7分,Gemini 3.1 Pro下跌5.6分,GPT-5.5上涨5.3分。Grok 4以94.80分保持首位,3升1降格局下,守约能力分化加剧。
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4,doubao-pro低至1.5/4;工程规范场景区分度最大,最高4/4与最低1/4相差3分。Claude-opus-4.7在四场景拿4/4,唯工程规范跌至3/4,暴露明显偏科。
v2锚点题显示,11模型R1确认率95%、R2抵抗率86%,但R3诚信率仅45.5%,9次完全崩盘。GPT-5.5与Qwen3 Max崩盘率达20%,Grok 4等四模型零崩盘,暴露多约束场景下的守约断层。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro下滑5.6分。
2026-07-29 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 89.3 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6今日Smoke评测中代码执行从97.00分跌至75.00分,材料约束从60.20分升至85.90分,主榜仅从80.44分微降至79.91分。单日10题抽签导致的波动可能是主因,需持续观察。
DeepSeek V4 Pro今日Smoke评测中代码执行从100.00降至75.00,材料约束从68.20升至95.00,主榜仅微降1.7分至84.00。工程判断同步下滑19.5分。单日10题抽样下,此类波动需区分随机题目难度与模型真实能力退化。
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro今日Smoke评测中材料约束从100分跌至68.2分,降31.8分;代码执行从69.5分升至100分,主榜反而升2.46分至85.69。单日2题抽样导致的剧烈波动是主因,诚信评级仍为pass。
GPT-o3今日Smoke评测中代码执行从44.50升至97.00,材料约束从100.00降至84.30,主榜从69.48升至91.29。材料约束单日下跌15.7分,需判断是抽签波动还是真实退化。
2026-07-27 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 91.29 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。