WDCD五大场景横评:业务规则成最难关,Grok-4满分Claude-sonnet仅1.8
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。
2026-07-26 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 83.23 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端服务能力。
MLCommons Edge LLM Taskforce宣布在MLPerf Inference v6.1中引入Edge Agentic Inference基准,聚焦设备端Agentic LLM在单边缘加速器上的工具调用准确率与单用户延迟表现。
MLCommons与Google Cloud在Google Cloud Next 2026展示MedPerf接入Confidential Space,用于脑肿瘤MRI分割模型的联邦基准评测。该方案在不迁移患者数据的前提下,同时保护模型权重、数据与评测结果,提升医疗AI真实世界验证的可信度。
随着长上下文、Agent 和推荐类 LLM 工作负载增长,Prefix caching 的瓶颈正从命中率转向 KV Cache 搬运带宽。Netpreme X-Mem™ 为 SGLang HiCache 增加高带宽专用 KV 内存层,在前缀密集场景显著降低 TTFT 并提升系统吞吐。
DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、overlap scheduler 与 SPS cost table 将算法收益落到真实服务吞吐上。
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通过100步以上训练验证了奖励与AIME-2024成绩提升。
SGLang Team 披露了 GLM-5.2-NVFP4 在 Blackwell B300 上的两周优化成果:通过 Spec V2、IndexShare MTP、TopK-V2、Indexer Prologue Fusion 与 BF16 GEMM 改进,8×B300、bs=1 场景下吞吐突破 500 TPS。
SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink MoE 架构定制优化,在 Blackwell GPU 上实现最高 71.7k tok/s 输入吞吐与 171 tok/s 单用户解码速度,并支持 DFlash 推测解码与全参数/LoRA RL 训练。
Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升 DAPO 表现。
2026-07-24 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 84.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针 100.00 分。历史 7 次 run 中 GLM-4.6 已出现 3 次 fail,需持续观察。
2026-07-23 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。
v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素。
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。
2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。
Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。
2026-07-21 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 GPT-o3 以 96.27 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。
Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。
2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。