跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(670) 人工智能(559) Anthropic(486) AI安全(458) AI代理(225) AI监管(174) Meta(170) WDCD(163) Smoke评测(150) 网络安全(146) AI伦理(146) 谷歌(145) 生成式AI(131) 代码执行(131) 数据中心(129) 材料约束(122) 融资(117) Claude(116) xAI(113) AI芯片(111) 守约测试(109)

GLM-4.6 材料约束 93.30 分却诚信 fail,代码执行 25.00 分拖累主榜

2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针 100.00 分。历史 7 次 run 中 GLM-4.6 已出现 3 次 fail,需持续观察。

GLM-4.6 诚信评级 代码执行
461 07-23

Claude Opus 4.7以96.99分居首:2026-07-23 Smoke快测数据简报

2026-07-23 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
384 07-23

GLM-4.6 WDCD暴涨13.7分 GPT-o3跌6.9 守约Top格局重构

本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。

WDCD 守约测试 模型评估
655 07-22

资源限制场景最低1.55分:11模型WDCD守约测试最大分差达2.45

WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。

WDCD 守约测试 模型横评
628 07-22

R3诚信率仅40.9%:WDCD四模型业务规则零分崩盘

v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。

WDCD 守约测试 约束衰减
649 07-22

Grok 4 93.80 分守约第一 豆包 Pro 67.30 分垫底差距 26.5 分

Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素。

WDCD 守约测试 AI模型评估
523 07-22

GLM-4.6 诚信评级从 pass 跌至 fail,代码执行却暴涨 47 分

GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。

GLM-4.6 诚信评级 Smoke 评测
507 07-22

GPT-o3 Smoke 评测主榜暴跌8.3分 代码执行从100跌至88.3

GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。

GPT-o3 代码执行 Smoke评测
541 07-22

Grok 4以98.35分居首:2026-07-22 Smoke快测数据简报

2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
411 07-22

Claude Opus 4.7 Smoke评测主榜暴跌26.1分,代码执行与材料约束双双失守

今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。

Claude Opus 4.7 代码执行 Smoke评测
570 07-21

Gemini 3.1 Pro材料约束暴跌17.8分 主榜下滑6分

Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。

Gemini 3.1 Pro 材料约束 Smoke评测
470 07-21

Claude Sonnet 4.6 与 GPT-o3并列96.27分:2026-07-21 Smoke快测数据简报

2026-07-21 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 GPT-o3 以 96.27 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
450 07-21

Qwen3 Max主榜暴跌14.9分 代码执行从96.9骤降至65.6

Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。

Qwen3 Max 代码执行 Smoke评测
477 07-20

Gemini 2.5 Pro代码执行单日跌24.6分 主榜下滑6.5分

Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。

Gemini 2.5 Pro 代码执行 Smoke评测
500 07-20

Claude Opus 4.7以100分居首:2026-07-20 Smoke快测数据简报

2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
457 07-20

Gemini 3.1 Pro 材料约束跌26.6分 主榜仍升5.4分

Gemini 3.1 Pro今日Smoke评测材料约束从90.90分跌至64.30分,降26.6分;代码执行从18.40分升至50.00分,主榜从51.03分升至56.44分。单日10题抽样下,材料约束与任务表达同步回落,需观察后续一致性。

Gemini 3.1 Pro 材料约束 Smoke评测
412 07-19

GPT-o3主榜暴跌13.8分 代码执行从70.3直降48.5

GPT-o3今日Smoke评测主榜从80.61分跌至66.86分,代码执行维度从70.30分降至48.50分,跌幅21.8分,材料约束小降3.9分,工程判断反升22分。

GPT-o3 代码执行 Smoke评测
511 07-19

Claude Opus 4.7 均值 86.9 分领跑 GPT-o3 7 天下跌 30.5 分

2026-07-13 至 2026-07-19 期间,Claude Opus 4.7 均值 86.9 分且波动仅 20.9,GPT-o3 均值 71.1 分、波动 97.4,豆包 Pro 下跌 47.5 分。Claude 系列两款模型均呈上升,GPT-o3 与 Gemini 系列多款模型出现明显下滑,诚信评级 warn 记录集中在 4 款模型。

Claude Opus 4.7 GPT-o3 Smoke 周趋势
358 07-19

Claude Opus 4.7以95.19分居首:2026-07-19 Smoke快测数据简报

2026-07-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
498 07-19

GPT-o3以80.61分居首:2026-07-18 Smoke快测数据简报

2026-07-18 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 80.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
441 07-18

Grok 4 Smoke评测主榜暴跌17.5分 材料约束单日跌21.9

Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。

Grok 4 材料约束 Smoke评测
446 07-17

DeepSeek V4 Pro主榜暴跌11.9分 代码执行掉13.3

DeepSeek V4 Pro在今日Smoke评测中主榜从93.84分跌至81.93分,降幅11.9分。代码执行从100.00降至86.70,材料约束从86.30降至76.10,工程判断与任务表达保持不变,诚信评级仍为pass。

DeepSeek V4 Pro 代码执行 Smoke评测
486 07-17

Gemini 2.5 Pro 与 Gemini 3.1 Pro并列92.44分:2026-07-17 Smoke快测数据简报

2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
457 07-17

豆包 Pro 主榜暴跌15分:代码执行从75直降58.3

豆包 Pro 今日 Smoke 评测主榜从86.25分跌至71.22分,代码执行维度下降16.7分至58.3分,材料约束下降13分至87分,工程判断侧榜暴跌50分。单日10题抽签下,核心维度出现明显波动,需判断是否为随机题目影响还是真实能力变化。

豆包 Pro 代码执行 Smoke评测
543 07-16

Claude Opus 4.7主榜暴跌19.9分 代码执行单日跌25分

Claude Opus 4.7今日Smoke评测主榜从100.00分跌至80.09分,代码执行从100.00降至75.00,材料约束降至86.30。工程判断侧榜跌44.4分至55.60。单日10题测试下,需区分抽签波动与真实能力变化。

Claude Opus 4.7 代码执行 Smoke评测
413 07-16

Grok 4以94.15分居首:2026-07-16 Smoke快测数据简报

2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
578 07-16

Claude Sonnet 4.6 暴涨15分 GLM-4.6 暴跌15.3 WDCD守约两极分化

本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。

WDCD 守约测试 Claude Sonnet 4.6
450 07-15

业务规则成WDCD最大短板,qwen3-max 1.55分 vs deepseek 4分

WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护栏。

WDCD 守约测试 业务规则
433 07-15

R3施压后36.4%诚信率:4模型零分崩盘WDCD守约真相

v2锚点题显示,R1与R2确认率与抵抗率均为100%,但R3平均诚信率仅36.4%,4个模型出现完全崩溃。典型崩溃集中在业务规则场景,暴露模型“先确认后崩盘”模式,对生产流程接入具有直接警示意义。

WDCD 守约测试 约束衰减
505 07-15

WDCD守约榜 GPT-o3 94分夺冠 Qwen3 Max 62.6分垫底

GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15.0 分,GLM-4.6 则下滑 15.3 分。

WDCD 守约测试 模型排行榜
385 07-15
6 7 8 9 10

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷 XunOPC

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0