跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(522) 人工智能(467) Anthropic(397) AI安全(310) AI代理(183) Meta(135) AI伦理(125) AI监管(125) WDCD(122) 谷歌(119) 生成式AI(111) xAI(105) Smoke评测(104) 数据中心(103) 代码执行(99) 网络安全(98) 融资(94) Claude(94) AI(92) AI芯片(91) 材料约束(91)

Claude 19.8分最大增幅 WDCD八模型全线上涨无一下降

本期WDCD测试中8个模型全部上涨、零下降,Claude Opus 4.7增幅达19.8分,Gemini 3.1 Pro以93.57分登顶,Grok 4紧随其后92.86分。

WDCD 守约测试 模型性能变化
400 06-28

WDCD横评:安全合规成最大短板,11模型最高仅3.57分

WDCD五场景测试显示安全合规全体得分最低,最高仅deepseek-v4-pro 3.57/4,claude-sonnet-4.6垫底2.57/4;gemini-3.1-pro在数据边界与资源限制双4分,grok-4在业务规则独得4分,doubao-pro工程规范领先。

WDCD 守约测试 安全合规
328 06-28

Grok 4零崩溃碾压GPT-o3 17%崩盘 WDCD三轮衰减暴露真实韧性

WDCD三轮测试显示,R1平均确认率0.95,R2抵抗率0.82,R3平均诚信率仅1.63/2。Grok 4在R3保持1.83/2且零崩溃,而Claude Sonnet 4.6与GPT-o3各崩6次(17.1%),多约束场景成为最大崩盘诱因。

WDCD 守约测试 三轮衰减
590 06-28

Gemini 3.1 Pro 93.57分 WDCD守约第一 文心一言4.5仅75.71分垫底

Gemini 3.1 Pro 以 WDCD 93.57 分位居首位,文心一言 4.5 以 75.71 分垫底。头部三名 R3 得分均超 1.69,尾部两名 R3 仅 1.34-1.54,R3 崩溃率达 8.8%。

WDCD 守约测试 排行榜分析
301 06-28

Claude Sonnet 4.6 Smoke评测主榜暴跌25.9分 代码执行从100降至50

在赢政指数2026年6月Smoke评测中,Claude Sonnet 4.6主榜从96.45分跌至70.52分,代码执行维度从100.00直接腰斩至50.00。材料约束反而小幅上升3.5分,工程判断保持满分,诚信评级维持pass。

Claude Sonnet 4.6 代码执行 Smoke评测
322 06-28

Claude Opus 4.7代码执行从100暴跌至50 主榜单日掉25.7分

赢政指数今日Smoke评测中,Claude Opus 4.7代码执行从100.00分跌至50.00分,主榜从97.12分降至71.47分,单日暴跌25.7分。材料约束小幅回升,工程判断和任务表达保持高位,诚信评级仍为pass。

Claude Opus 4.7 代码执行 Smoke评测
284 06-28

赢政指数Smoke周报:文心一言4.5下滑37.2分,多模型波动超28

2026-W26 Smoke日测数据显示,文心一言4.5从98.74跌至61.52,趋势-37.2;Claude Sonnet 4.6、Claude Opus 4.7波动分别达28.4和28.5。豆包Pro持平,诚信评级改善模型仅两家。数据揭示多数模型末日得分集体回落,稳定性成为下周Full评测关键变量。

文心一言 4.5 Claude Sonnet 4.6 Smoke测试
195 06-28

豆包Pro 98.61分登顶 Smoke评测,Claude执行-50分暴跌

2026-06-28 Smoke评测中,豆包Pro以执行100分、约束96.9分拿下主榜98.61分首位。Claude Opus 4.7与Sonnet 4.6执行从昨日100分骤降至50分,主榜分别下跌25.7分和25.9分。Gemini 3.1 Pro主榜升至91.21分,执行与约束均衡。

豆包 Pro Claude Opus 执行维度
273 06-28

Claude Opus 4.7 97.12 分领跑,执行满分但材料约束 93.6 分拉低整体

2026-06-27 Smoke 评测显示,Claude Opus 4.7 以 97.12 分位居第一,代码执行 100 分、材料约束 93.6 分。Claude Sonnet 4.6 紧随其后,主榜 96.45 分。三个模型并列第三,主榜均为 83.37 分,执行 75 分、约束 93.6 分。文心一言 4.5 执行骤降 37.5 分。

Claude Opus 4.7 代码执行 Smoke轻量评测
287 06-27

Qwen3 Max代码执行暴跌50分,主榜仅降1.5分

Qwen3 Max在今日Smoke评测中代码执行从100.00分跌至50.00分,主榜从74.00分微降至72.50分。材料约束升至100.00分,诚信评级从fail转为pass,单日波动幅度达50分。

Qwen3 Max 代码执行 烟雾测试
389 06-24

Claude Opus 4.7 Smoke评测主榜暴跌27.5分,代码执行从100直降50

Claude Opus 4.7今日Smoke评测主榜从100.00跌至72.50分,代码执行维度从100.00暴跌至50.00分,材料约束保持100.00不变,工程判断从83.40升至100.00,诚信评级维持pass。

Claude Opus 4.7 代码执行 Smoke快测
422 06-24

4模型执行分暴跌至50,文心一言主榜狂掉34.1分

2026-06-24 Smoke评测中,文心一言4.5主榜暴跌34.1分至64.63,Claude Opus 4.7和Claude Sonnet 4.6分别下跌27.5分与24.4分,核心原因是代码执行从100直接跌至50。今日前三名DeepSeek V4 Pro、Gemini 3.1 Pro、Grok 4均拿下执行与约束双100。

代码执行 材料约束 文心一言4.5
478 06-24

Qwen3 Max Smoke评测主榜暴跌12分 诚信评级从pass转为fail

Qwen3 Max今日Smoke评测主榜从85.96分跌至74.00分,代码执行持平100.00分,材料约束从68.80分升至95.70分,但工程判断和任务表达双双大跌,诚信评级由pass转为fail。

Qwen3 Max 主榜 Smoke评测
431 06-23

Qwen3 Max主榜暴跌12分至74,诚信fail拉低整体

2026-06-23 Smoke评测显示,Qwen3 Max主榜74分暴跌12分,诚信从pass转为fail。Claude Opus 4.7、Gemini 3.1 Pro、Grok 4三模型以执行100、约束100拿下满分主榜。文心一言4.5主榜升至98.74,约束97.2但诚信warn。执行维度11模型全为100,材料约束成为唯一分差来源。

Qwen3 Max 材料约束 Smoke轻量评测
396 06-23

Gemini 2.5 Pro主榜暴跌28分,代码执行从100直接腰斩

Gemini 2.5 Pro在今日Smoke评测中主榜从99.28分跌至71.33分,暴跌28分,主要源于代码执行维度从100.00分直接跌至50.00分。材料约束微降1分,其他维度持平或微升,诚信评级维持pass。

Gemini 2.5 Pro 代码执行 Smoke评测
380 06-22

Qwen3 Max材料约束暴跌26.7分,代码执行却升至100分

赢政指数今日Smoke评测显示,Qwen3 Max材料约束从95.50跌至68.80(-26.7),代码执行从68.80升至100.00(+31.2),主榜从80.82升至85.96(+5.1)。单日10题快测波动正常,但需区分抽签与真实退化。

Qwen3 Max 材料约束 Smoke评测
336 06-22

文心一言主榜暴跌40.3分,Smoke评测揭露执行约束双崩

2026-06-22 Smoke评测显示GPT-5.5与GPT-o3主榜100分并列第一,文心一言4.5主榜仅47.98分暴跌40.3分,Gemini 2.5 Pro主榜71.33分大降28分,Qwen3 Max材料约束跌26.7分,执行与约束结构差异显著。

文心一言 材料约束 GPT-5.5
386 06-22

Qwen3 Max主榜暴跌19.2分,代码执行单日掉31.2分

赢政指数2026年6月Smoke评测显示,Qwen3 Max主榜从100分跌至80.82分,代码执行维度从100分降至68.80分,降幅31.2分。材料约束仅降4.5分,诚信评级维持pass。单日10题快测下,此类波动需区分抽签因素与真实能力变化。

Qwen3 Max 代码执行 Smoke评测
499 06-21

Grok 4 趋势上涨19.8分领跑 Smoke 周报,Gemini 系列波动超28分

赢政指数 2026-W25 Smoke 7 天数据显示,Grok 4 趋势上涨 19.8 分至 100,DeepSeek V4 Pro 均值 98.7 分保持领先;Gemini 2.5 Pro 与 Gemini 3.1 Pro 波动分别达 28.3 分和 29 分,稳定性风险突出。

Grok 4 Gemini 2.5 Pro Smoke 周趋势
525 06-21

Qwen3 Max主榜暴跌19.2分 四模型执行约束双满分

2026-06-21 Smoke评测中,DeepSeek V4 Pro、Gemini 3.1 Pro、GPT-o3、Grok 4四模型主榜、执行、约束三项均为100分。Qwen3 Max主榜暴跌19.2分至80.82,执行维度从昨日高位跌至68.8,成为当日最大异常。

Qwen3 Max 代码执行 Smoke轻量评测
347 06-21

文心一言4.5 Smoke主榜暴跌22.2分 代码执行直接腰斩至50分

文心一言4.5今日Smoke评测主榜从93.25分跌至71.02分,暴跌22.2分。代码执行维度从94.10分直接跌至50.00分,材料约束小涨至96.70分。单日10题快测中,代码执行表现出现显著异常。

文心一言4.5 代码执行 Smoke测试
436 06-20

GPT-5.5 Smoke评测主榜暴跌20.5分,代码执行从100直降50

GPT-5.5今日Smoke评测主榜从93.03分跌至72.50分,暴跌20.5分。代码执行从100.00分腰斩至50.00分,材料约束则从84.50分升至100.00分。单日10题抽签导致的波动可能是主因,仍需持续观察。

GPT-5.5 代码执行 Smoke快测
362 06-20

GPT-5.5执行分暴跌至50 Gemini 3.1 Pro主榜狂掉28.3分

2026-06-20 Smoke轻量评测显示,GPT-5.5、Gemini 3.1 Pro等四模型执行分集体跌至50,主榜分别暴跌20.5至28.3分。Claude Opus 4.7与Qwen3 Max以100分并列第一,执行与约束双满分。低分模型约束分仍维持96.7-100分,暴露执行维度成为今日最大分化点。

GPT-5.5 代码执行 Smoke评测
377 06-20

豆包 Pro 材料约束暴跌15.9分 Smoke单日测试异常成因

豆包 Pro 在今日 Smoke 评测中材料约束从 100.00 分跌至 84.10 分,主榜从 100.00 分降至 92.85 分。代码执行、工程判断、任务表达三项维持满分,诚信评级仍为 pass。

豆包 Pro 材料约束 Smoke评测
407 06-19

GPT-o3材料约束单日暴跌15.2分 Smoke主榜从100跌至93.16

GPT-o3今日Smoke评测材料约束从100.00分跌至84.80分,主榜从100.00降至93.16分。代码执行、工程判断、任务表达三项保持满分,诚信评级维持pass。单日10题快测下,此类波动是否反映真实退化值得追踪。

GPT-o3 材料约束 Smoke评测
373 06-19

Smoke评测:Qwen3 Max约束+23分逆袭,GPT-o3材料约束暴跌15.2分

2026年6月19日Smoke评测显示,Gemini 3.1 Pro以99.28分继续领跑。Qwen3 Max约束从昨日大幅提升23分,主榜升至97.35分;GPT-o3和豆包Pro材料约束分别暴跌15.2分和15.9分,暴露结构脆弱性。

Qwen3 Max 材料约束 Gemini 3.1 Pro
321 06-19

Grok 4材料约束暴跌25.6分 主榜却逆势升至87分

在赢政指数今日Smoke评测中,Grok 4材料约束从96.70分跌至71.10分,降幅25.6分,但代码执行升至100分、主榜升至87分。单日10题快测下,多维度剧烈波动更可能源于题目抽签而非模型退化。

Grok 4 材料约束 Smoke评测
516 06-18

Grok 4材料约束暴跌25.6分 四模型主榜满分并列

2026-06-18 Smoke评测中,Claude Opus 4.7等四模型主榜、执行、约束三项均达100分。Grok 4材料约束单日暴跌25.6分至71.1分,导致主榜仅87分,与满分模型差距13分。执行维度11模型中有10个满分,约束维度则明显分化。

Grok 4 材料约束 Smoke评测
459 06-18

WDCD三轮衰减实测:GPT-o3 R3崩溃率50% Qwen3 Max零崩盘

WDCD三轮测试显示,R1平均确认率0.96,R2抵抗率降至0.76,R3平均诚信率仅75.5%。GPT-o3 R3崩溃率达50%,而Qwen3 Max、Claude Sonnet 4.6、文心一言4.5实现零崩溃,暴露多约束场景下的诚信断崖。

WDCD 守约测试 模型衰减
638 06-17

Qwen3 Max 92.50分登顶 WDCD守约榜 豆包Pro 62.50分垫底差距30分

Qwen3 Max以92.50分位居WDCD守约排行榜首位,豆包Pro以62.50分垫底,头部与尾部相差30分。满分率47.3%,R3崩溃率16.4%。Claude Sonnet 4.6和DeepSeek V4 Pro分列二三位,GPT-o3和豆包Pro位居后两名。

WDCD 守约测试 Qwen3 Max
632 06-17
4 5 6 7 8

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0