跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(691) 人工智能(563) Anthropic(501) AI安全(492) AI代理(233) AI监管(188) Meta(175) WDCD(168) Smoke评测(155) 谷歌(149) 网络安全(147) AI伦理(147) 生成式AI(138) 数据中心(136) 代码执行(133) 材料约束(125) 融资(122) Claude(118) AI芯片(115) xAI(114) 守约测试(113)

11模型WDCD三轮锚点:R3诚信率仅45.5%,Qwen3 Max与Claude Sonnet对决

v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施压下的真实差异。

WDCD 守约测试 约束衰减
232 09-09

Grok 4 93.80 分登顶 WDCD 守约榜,GLM-4.6 68 分垫底差距 25.8 分

Grok 4 以 93.80 分位居 WDCD v3.1 守约榜首,GLM-4.6 以 68.00 分垫底。11 个模型中 R3 崩溃率 9.1%,满分率 48.2%。头部与尾部差距主要体现在 R3 施压阶段的约束维持能力上。

WDCD 守约测试 AI模型约束
168 09-09

Claude Sonnet 4.6材料约束暴跌33.6分 主榜下滑4.4

Claude Sonnet 4.6今日Smoke评测中材料约束从100.00跌至66.40,主榜从86.25降至81.86。代码执行反升19.5分至94.50,工程判断下滑17.5分。单日10题抽签下,材料约束大幅波动值得持续观察。

Claude Sonnet 4.6 材料约束 Smoke评测
153 09-09

Grok 4 材料约束暴跌17.8分 代码执行反升18.5分 Smoke评测主榜仍涨2.2

Grok 4在今日Smoke评测中材料约束从100.00跌至82.20,代码执行从75.00升至93.50,主榜从86.25升至88.42。单日10题快测下,材料约束-17.8分的跌幅与代码执行+18.5分的涨幅形成明显反差,工程判断小降2.8分,任务表达小升4.1分。

Grok 4 材料约束 Smoke评测
136 09-09

豆包 Pro以89.91分居首:2026-09-09 Smoke快测数据简报

2026-09-09 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 89.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
359 09-09

Claude Sonnet 4.6 与 Grok 4并列86.25分:2026-09-08 Smoke快测数据简报

2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
381 09-08

GPT-o3材料约束暴跌20分 主榜反升4.8分

GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,需判断是抽签波动还是真实能力退化。

GPT-o3 材料约束 Smoke评测
333 09-07

豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分

豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50分。单日10题测试下,维度分数剧烈波动,需判断是否为抽签波动还是真实退化。

豆包 Pro 材料约束 Smoke评测
267 09-07

DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6并列83.49分:2026-09-07 Smoke快测数据简报

2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
346 09-07

Claude Sonnet 4.6跌5分豆包Pro涨7.5分 WDCD v3.1守约测试暴露稳定性反差

Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。

WDCD 守约测试 Claude Sonnet 4.6
412 09-06

WDCD五场景横评:安全合规最低2.19分,glm-4.6四场景称霸

WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。

WDCD 守约测试 场景横评
376 09-06

R3诚信率仅49.5%:11模型WDCD三轮守约崩盘实测

v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦资源限制与安全合规场景下的逐轮衰减规律及生产选型风险。

WDCD 守约测试 约束衰减
379 09-06

Grok 4守约93.21分登顶 WDCD榜 Qwen3 Max74.31垫底

Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。

WDCD 守约测试 AI模型排行
311 09-06

Gemini 2.5 Pro以88.21分居首:2026-09-06 Smoke快测数据简报

2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
349 09-06

GLM-4.6材料约束暴跌21分,代码执行反升25分,主榜微涨4.3

GLM-4.6今日Smoke评测材料约束从74.30分跌至53.30分(-21),代码执行从50.00升至75.00(+25),主榜从60.94升至65.24(+4.3),工程判断从25.00升至95.80,诚信评级从pass变为warn。单日10题抽签波动与真实退化需区分。

GLM-4.6 材料约束 Smoke评测
317 09-05

Qwen3 Max代码执行暴跌21.7分 材料约束反涨20.4分

Qwen3 Max今日Smoke评测中代码执行从96.70分跌至75.00分,材料约束从48.80分升至69.20分,主榜从75.15分降至72.39分,诚信评级由pass转为warn。单日维度剧烈波动但整体影响有限。

Qwen3 Max 代码执行 Smoke评测
329 09-05

GPT-o3以90.64分居首:2026-09-05 Smoke快测数据简报

2026-09-05 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 90.64 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
324 09-05

GLM-4.6材料约束+28.2分却工程判断-39.6 诚信从fail升pass主榜反涨12.7

GLM-4.6今日Smoke评测主榜从48.25升至60.94,材料约束从46.10升至74.30,工程判断从64.60跌至25.00,任务表达从50.00跌至25.00,诚信评级从fail升至pass。单日10题抽签导致侧榜剧烈波动,主榜改善主要来自材料约束。

GLM-4.6 材料约束 Smoke评测
705 09-04

GPT-5.5代码执行从100暴跌至75 Smoke评测主榜降7.5分

GPT-5.5今日Smoke评测代码执行从100.00跌至75.00,主榜从79.12降至71.67。材料约束反升14分至67.60,工程判断同步跌25分。单日10题抽样导致的波动与模型真实退化需区分判断。

GPT-5.5 代码执行 Smoke评测
570 09-04

Claude Opus 4.7以92.49分居首:2026-09-04 Smoke快测数据简报

2026-09-04 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
1,639 09-04

GLM-4.6 探针得分 15.00 诚信 fail,主榜 48.25 分材料约束 46.10

2026-09-03 Run#307 中 GLM-4.6 诚信评级 fail,探针得分仅 15.00,主榜 48.25 分,代码执行 50.00,材料约束 46.10。其余 10 款模型全部 pass,探针得分 80-100。

GLM-4.6 诚信评级 代码执行
456 09-03

GPT-o3以83.94分居首:2026-09-03 Smoke快测数据简报

2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
319 09-03

Gemini 2.5 Pro WDCD暴涨22.2分,Claude Sonnet 4.6独跌13分

Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。

WDCD 守约测试 模型动态
373 09-02

WDCD五场景横评:安全合规最低仅2分,deepseek业务规则4分安全合规2.5分偏科1.5

安全合规场景全体得分最低,qwen3-max仅2/4,deepseek-v4-pro仅2.5/4;数据边界多模型4/4;deepseek-v4-pro业务规则4/4却安全合规2.5/4,差距1.5分。企业接入生产流程时需按场景加护栏。

WDCD 守约测试 场景横评
408 09-02

WDCD三轮测试:11模型R3诚信率仅72.7%,3模型R3完全崩溃

WDCD v3.1试点中,8道v2锚点题显示R1确认率100%、R2抵抗率73%、R3诚信率72.7%,110次采样中3次R3完全崩溃。GLM-4.6、DeepSeek V4 Pro、Qwen3 Max在安全合规多约束场景下先确认后崩盘,Gemini 3.1 Pro等8模型全程维持满分。

WDCD 守约测试 约束衰减
556 09-02

WDCD守约榜:Gemini 3.1 Pro 97.7分领跑 Qwen3 Max 70.3分垫底

Gemini 3.1 Pro以97.70分位居WDCD v3.1守约榜首位,Qwen3 Max 70.30分垫底,11模型中满分率68.2%,R3崩溃率仅2.7%。头部与尾部在R3施压阶段差距达2.00分,生产接入需重点关注安全合规场景。

WDCD 守约测试 AI模型排名
682 09-02

豆包 Pro以95.91分居首:2026-09-02 Smoke快测数据简报

2026-09-02 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 95.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
474 09-02

GPT-5.5代码执行暴跌25分 主榜仅降3分 材料约束反升24分

今日Smoke评测中GPT-5.5代码执行从94.50跌至69.50,材料约束从76.00升至100.00,主榜从86.18降至83.23。单日10题快测下,执行维度暴跌与约束维度暴涨形成对冲,需区分抽签波动与真实退化。

GPT-5.5 代码执行 Smoke评测
458 09-01

Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99

Grok 4今日Smoke评测代码执行从94.50分跌至72.70分,材料约束升至100.00分,主榜下滑4.2分至84.99分。工程判断与任务表达均有提升,诚信评级维持pass。分析显示小样本题目抽签是主要波动来源。

Grok 4 代码执行 Smoke评测
382 09-01

GPT-o3以96.98分居首:2026-09-01 Smoke快测数据简报

2026-09-01 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
362 09-01
1 2 3 4

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷 XunOPC

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0