跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(510) 人工智能(457) Anthropic(390) AI安全(295) AI代理(179) Meta(133) AI伦理(124) AI监管(124) WDCD(117) 谷歌(116) 生成式AI(109) xAI(105) Smoke评测(101) 数据中心(100) 代码执行(99) 融资(93) Claude(93) AI(92) AI芯片(90) 网络安全(90) 材料约束(89)

WDCD五大场景横评:业务规则成最难关,Grok-4满分Claude-sonnet仅1.8

WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。

WDCD 守约测试 模型横评
297 07-26

R3诚信率仅50.6%:Grok 4零崩溃 GPT-o3 20%崩盘

v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。

WDCD 守约测试 约束衰减
284 07-26

DeepSeek V4 Pro以83.23分居首:2026-07-26 Smoke快测数据简报

2026-07-26 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 83.23 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
274 07-26

Claude Sonnet 4.6 与 Grok 4并列96.98分:2026-07-25 Smoke快测数据简报

2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
276 07-25

MLPerf Tiny:超低功耗AI的关键基准

随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。

MLC MLPerf Tiny TinyML
337 07-25

MLPerf Inference迈向智能体时代:新增多轮Agentic Inference基准

MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端服务能力。

MLC MLPerf 智能体推理
281 07-25

MLPerf v6.1征集边缘Agentic推理基准结果

MLCommons Edge LLM Taskforce宣布在MLPerf Inference v6.1中引入Edge Agentic Inference基准,聚焦设备端Agentic LLM在单边缘加速器上的工具调用准确率与单用户延迟表现。

MLC MLPerf 边缘AI
393 07-25

MedPerf接入Google Cloud机密计算:为脑肿瘤AI评测加密护航

MLCommons与Google Cloud在Google Cloud Next 2026展示MedPerf接入Confidential Space,用于脑肿瘤MRI分割模型的联邦基准评测。该方案在不迁移患者数据的前提下,同时保护模型权重、数据与评测结果,提升医疗AI真实世界验证的可信度。

MLC 医疗AI 机密计算
312 07-25

Netpreme X-Mem 加速 SGLang HiCache:TTFT 最高提升 6.7 倍

随着长上下文、Agent 和推荐类 LLM 工作负载增长,Prefix caching 的瓶颈正从命中率转向 KV Cache 搬运带宽。Netpreme X-Mem™ 为 SGLang HiCache 增加高带宽专用 KV 内存层,在前缀密集场景显著降低 TTFT 并提升系统吞吐。

LMSYS SGLang KV Cache
204 07-25

DSpark接入SGLang:用置信度驱动可变长度验证

DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、overlap scheduler 与 SPS cost table 将算法收益落到真实服务吞吐上。

LMSYS SGLang DSpark
219 07-25

DeepSeek-V4 Flash强化学习登陆AMD MI355X

AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通过100步以上训练验证了奖励与AIME-2024成绩提升。

LMSYS AMD ROCm
229 07-25

SGLang 两周优化 GLM-5.2:8×B300 上突破 500 TPS

SGLang Team 披露了 GLM-5.2-NVFP4 在 Blackwell B300 上的两周优化成果:通过 Spec V2、IndexShare MTP、TopK-V2、Indexer Prologue Fusion 与 BF16 GEMM 改进,8×B300、bs=1 场景下吞吐突破 500 TPS。

LMSYS SGLang GLM-5.2
313 07-25

SGLang 与 Miles 首日支持 Inkling:975B 多模态前沿模型上线

SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink MoE 架构定制优化,在 Blackwell GPU 上实现最高 71.7k tok/s 输入吞吐与 171 tok/s 单用户解码速度,并支持 DFlash 推测解码与全参数/LoRA RL 训练。

LMSYS SGLang Inkling
244 07-25

Miles 引入 OPD:让蒸馏成为后训练原语

Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升 DAPO 表现。

LMSYS Miles OPD
252 07-25

Grok 4以84.21分居首:2026-07-24 Smoke快测数据简报

2026-07-24 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 84.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
228 07-24

GLM-4.6 材料约束 93.30 分却诚信 fail,代码执行 25.00 分拖累主榜

2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针 100.00 分。历史 7 次 run 中 GLM-4.6 已出现 3 次 fail,需持续观察。

GLM-4.6 诚信评级 代码执行
137 07-23

Claude Opus 4.7以96.99分居首:2026-07-23 Smoke快测数据简报

2026-07-23 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
223 07-23

GLM-4.6 WDCD暴涨13.7分 GPT-o3跌6.9 守约Top格局重构

本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。

WDCD 守约测试 模型评估
277 07-22

资源限制场景最低1.55分:11模型WDCD守约测试最大分差达2.45

WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。

WDCD 守约测试 模型横评
239 07-22

R3诚信率仅40.9%:WDCD四模型业务规则零分崩盘

v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。

WDCD 守约测试 约束衰减
235 07-22

Grok 4 93.80 分守约第一 豆包 Pro 67.30 分垫底差距 26.5 分

Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素。

WDCD 守约测试 AI模型评估
178 07-22

GLM-4.6 诚信评级从 pass 跌至 fail,代码执行却暴涨 47 分

GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。

GLM-4.6 诚信评级 Smoke 评测
181 07-22

GPT-o3 Smoke 评测主榜暴跌8.3分 代码执行从100跌至88.3

GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。

GPT-o3 代码执行 Smoke评测
190 07-22

Grok 4以98.35分居首:2026-07-22 Smoke快测数据简报

2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
200 07-22

Claude Opus 4.7 Smoke评测主榜暴跌26.1分,代码执行与材料约束双双失守

今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。

Claude Opus 4.7 代码执行 Smoke评测
227 07-21

Gemini 3.1 Pro材料约束暴跌17.8分 主榜下滑6分

Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。

Gemini 3.1 Pro 材料约束 Smoke评测
186 07-21

Claude Sonnet 4.6 与 GPT-o3并列96.27分:2026-07-21 Smoke快测数据简报

2026-07-21 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 GPT-o3 以 96.27 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
214 07-21

Qwen3 Max主榜暴跌14.9分 代码执行从96.9骤降至65.6

Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。

Qwen3 Max 代码执行 Smoke评测
190 07-20

Gemini 2.5 Pro代码执行单日跌24.6分 主榜下滑6.5分

Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。

Gemini 2.5 Pro 代码执行 Smoke评测
186 07-20

Claude Opus 4.7以100分居首:2026-07-20 Smoke快测数据简报

2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
204 07-20
1 2 3 4

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0