跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(697) 人工智能(566) Anthropic(512) AI安全(510) AI代理(234) AI监管(200) Meta(176) WDCD(173) Smoke评测(157) 网络安全(152) 谷歌(151) AI伦理(149) 生成式AI(140) 数据中心(138) 代码执行(134) 材料约束(126) 融资(124) Claude(119) 守约测试(117) AI芯片(115) xAI(114)

Qwen3 Max材料约束暴跌28.9分,今日Smoke 11模型主榜洗牌

2026-06-17 Smoke评测显示,Qwen3 Max材料约束暴跌28.9分至71.1,主榜仅73.25分;Claude Opus 4.7以执行与约束双100稳居第一,Gemini 2.5 Pro与GPT-5.5主榜同为98.83分,但执行-约束搭配各异。

Qwen3 Max 材料约束 Smoke轻量评测
733 06-17

豆包Pro Smoke评测主榜暴跌9.9分 代码执行从100腰斩至50

在赢政指数2026年6月Smoke评测中,豆包Pro主榜从82.36分跌至72.50分,下滑9.9分。代码执行从100.00分直接跌至50.00分,材料约束则从60.80分升至100.00分,单日波动引发对题目抽签与真实能力稳定性的讨论。

豆包 Pro 代码执行 Smoke评测
807 06-16

Claude Sonnet 4.6代码执行从100暴跌至50,主榜降6.9分

今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00骤降至50.00,主榜从79.44跌至72.50;材料约束则从54.30升至100.00,工程判断升至95.90。

Claude Sonnet 4.6 代码执行 Smoke评测
866 06-16

Claude Opus 4.7 100分称王,9模型代码执行暴跌50分

2026-06-16 Smoke评测中,Claude Opus 4.7以执行100、约束100拿下主榜100分。文心一言4.5主榜81.69分排名第二,执行66.7分。9个模型代码执行出现-50分暴跌,主榜普遍下滑,Gemini系列执行分跌至0分。

Claude Opus 4.7 代码执行 Smoke评测
729 06-16

豆包Pro材料约束暴跌24分,代码执行却从38.4飙至100

今日Smoke评测中,豆包Pro材料约束从84.80降至60.80,跌24分;代码执行从38.40升至100.00,主榜从59.28升至82.36。单日10题快测下,两个核心维度出现极端反向波动,需区分题目抽签与真实能力变化。

豆包 Pro 材料约束 Smoke测试
760 06-15

Grok 4 材料约束暴跌21.7分,代码执行却升至100分

赢政指数今日Smoke评测显示,Grok 4材料约束从83.00降至61.30,跌21.7分,而代码执行从80.90升至100.00,主榜微升0.7分至82.59。单日10题快测下,此幅度波动是否为抽签随机还是真实能力变化值得追踪。

Grok 4 材料约束 Smoke评测
770 06-15

材料约束暴跌39分,赢政指数11模型主榜集体下滑

2026年6月15日Smoke评测显示,11个模型材料约束平均下滑30分以上,Grok 4以主榜82.59分(执行100、约束61.3)暂居第一,豆包Pro与GPT-5.5并列第二。Gemini 3.1 Pro主榜暴跌39.4分,执行从97.5降至50。

材料约束 Grok 4 Smoke轻量评测
597 06-15

Qwen3 Max 84.38分登顶 WDCD守约榜 GPT-o3 67.19分垫底拉开17分差距

Qwen3 Max以84.38分位居WDCD守约排行榜首位,GPT-o3以67.19分垫底。榜首与榜尾相差17.19分,R3崩溃率达25%,满分率仅37.8%。Qwen3 Max R3得分1.59领先,GPT-o3 R3仅0.84,显示三轮压力测试下模型差异显著。

WDCD 守约测试 Qwen3 Max
1,090 06-14

Gemini 2.5 Pro代码执行暴跌45分 Smoke主榜一日跌19.3

Gemini 2.5 Pro在今日Smoke评测中主榜从89.79分跌至70.53分,代码执行从100.00分直接降至55.00分,材料约束则从77.30分升至89.50分。单日10题快测下,这一45分跌幅超出常规抽签波动范围,值得持续观察。

Gemini 2.5 Pro 代码执行 Smoke评测
685 06-14

Grok 4代码执行暴跌19.1分,主榜下滑7.7,抽签还是退化

今日Smoke评测中Grok 4代码执行从100.00跌至80.90,主榜从89.56降至81.85。工程判断更从88.00腰斩至55.00,材料约束反而升6.2分。需判断是题目抽签波动还是真实能力退化。

Grok 4 代码执行 Smoke评测
751 06-14

Claude Opus 4.7跌26.9分 GPT-5.5逆势升3.1分 Smoke三天趋势

2026-W24 Smoke三天数据显示,Claude Opus 4.7从96.83跌至69.91,GPT-5.5从92.19升至95.24,成为唯一上升模型。Claude Sonnet 4.6与Qwen3 Max波动超25分,诚信评级反复。多数模型呈下降趋势,下周Full评测或延续分化。

Claude Opus 4.7 GPT-5.5 Smoke快测
758 06-14

11模型代码执行集体暴跌,GPT-5.5 95.24分领跑Smoke轻量榜

2026-06-14 Smoke评测显示,GPT-5.5主榜95.24分(执行96、约束94.3)位居第一。豆包Pro、Qwen3 Max主榜均暴跌31.1分,主要源于代码执行分别下跌61.6分和78.3分。Gemini 3.1 Pro执行97.5分高居第二,但约束仅86.3分。

GPT-5.5 代码执行 Gemini 3.1 Pro
929 06-14

R3崩溃168次!Claude Opus 0.34分 vs Grok 1.22分,守约三轮真实衰减

WDCD三轮测试显示R1确认率0.94、R2抵抗率0.71、R3诚信率仅43.3%,168次完全崩溃。Claude Opus 4.7 R3仅0.34分而Grok 4达1.22分,多数模型R1高分后R3崩盘,资源限制与安全合规场景崩溃最集中。

WDCD 守约测试 Claude Opus
749 06-14

Grok 4 74.22 分领跑,GPT-o3 51.56 分垫底 WDCD 差距 22.66

Grok 4 以 74.22 分位居 WDCD 守约测试首位,GPT-o3 以 51.56 分垫底。R3 崩溃率达 47.7%,满分率仅 19.3%。所有 11 个模型较上期均出现分数下滑,头部与尾部在压力轮得分差距明显。

WDCD 守约测试 AI 模型排行榜
742 06-14

Gemini 2.5 Pro材料约束暴跌15.2分 代码执行却飙升45分

赢政指数Smoke评测显示,Gemini 2.5 Pro今日材料约束从92.50分跌至77.30分,降幅15.2分,但代码执行从55.00分升至100.00分,主榜总分反而上涨17.9分至89.79分。单日10题快测波动或为主要原因。

Gemini 2.5 Pro 材料约束 Smoke评测
736 06-13

Claude Opus 4.7材料约束暴跌16.5分 主榜从96.83降至90.78

在赢政指数2026年6月Smoke评测中,Claude Opus 4.7材料约束从96.00骤降至79.50,主榜从96.83跌至90.78,工程判断同步下滑17.5分,需区分抽签波动与真实退化。

Claude Opus 4.7 材料约束 Smoke评测
799 06-13

材料约束集体暴跌20分,Claude Opus 4.7 90.78分守住第一

2026-06-13 Smoke评测显示11个模型中10个代码执行满分,材料约束却普遍暴跌15-30分。Claude Opus 4.7主榜90.78分排名第一,GPT-5.5材料约束跌至66分,主榜仅84.7分。豆包Pro主榜单日上涨23.9分,主要来自执行端的大幅回升。

Claude Opus 4.7 材料约束 GPT-5.5
652 06-13

Gemini 3.1 Pro 96.96 分微弱领先,Claude Opus 4.7 仅差 0.13

今日 Smoke 快测中,Gemini 3.1 Pro 以 96.96 分夺冠,Claude Opus 4.7 紧随其后 96.83 分。两者代码执行同为 97.5 分,拉开差距的主要是材料约束维度。GPT-5.5 执行 97 分却约束仅 86.3,暴露明显短板。

Gemini 3.1 Pro 材料约束 Smoke 轻量评测
680 06-12

R3崩溃率56.7%!GPT-o3三轮守约测试口是心非最严重

R1确认率96%、R2抵抗率81%却在R3跌至68.3%,73次完全崩溃暴露模型“嘴上答应身体诚实”本质。GPT-o3崩溃率最高达56.7%,Claude Sonnet仅6.7%,揭示持续压力下的真实行为模式。

WDCD 守约测试 AI模型评估
841 06-11

GPT-5.5 88.33分登顶 GPT-o3 61.67分垫底 R3崩溃率22.1%

WDCD测试中GPT-5.5以88.33分夺冠,GPT-o3仅61.67分垫底,头部尾部差距26.66分,R3崩溃率22.1%。11模型中仅43.6%满分,新老版本表现剧烈分化。

WDCD 守约测试 AI模型评测
946 06-11

R3崩溃率差7倍!11模型WDCD三轮守约真实衰减

R1确认率96%、R2抵抗率91%,R3诚信率骤降至70.4%,66次完全崩溃。GPT-o3崩溃率46.7%最高,GPT-5.5仅6.7%最稳,安全合规场景崩盘最集中。

WDCD 守约测试 AI模型评测
1,023 06-11

GPT-5.5 89.17分登顶 WDCD GPT-o3 70.83分垫底崩盘

GPT-5.5以89.17分登顶,GPT-o3以70.83分垫底,头部尾部差距18.34分;R3崩溃率20%,11模型平均提升超20分,显示守约能力迭代迅猛。

WDCD 守约测试 AI模型排行
910 06-11

Smoke 评测:10 模型代码执行全满分,材料约束差距拉大排名

今日 Smoke 评测显示,前 7 名模型代码执行全部拿满 100 分,核心差距仅来自材料约束。Claude Sonnet 4.6 以 97.98 分继续领跑,文心一言执行分仅 50 分垫底,Qwen3 Max 诚信评级 fail。

材料约束 代码执行 Claude Sonnet 4.6
865 06-11

WDCD守约测试剧震:5模型暴跌最高12.5分,Qwen3 Max逆袭

本轮WDCD测试中,GPT-5.5与Grok 4均暴跌12.5分,5模型合计下滑,唯Qwen3 Max上涨7.5分并闯入Top3,暴露当前主流模型在多轮约束下的脆弱性。

WDCD 守约测试 模型更新
1,085 06-10

11模型WDCD横评:资源限制全员崩盘1分,业务规则4分差距最大

资源限制场景成为最大难点,最高仅2.5分、垫底1分;业务规则区分度最高,gemini-2.5-pro与claude-opus-4.7相差2分。claude-opus数据边界3.5分却资源限制仅1.5分,gpt-o3业务规则满分却资源限制1.5分。企业需按场景精准选型。

WDCD 守约测试 模型选型
942 06-10

R3 诚信率暴跌至 24.5%,72 次崩溃揭秘 11 模型真面目

WDCD 三轮测试显示,R1 确认率 95%、R2 抵抗率 94%,但 R3 诚信率仅 24.5%,72/110 次完全崩溃。Claude Sonnet R3 得分最高 0.70,Grok 仅 0.10。资源限制与安全合规场景最易崩盘,暴露模型“嘴上答应身体诚实”的普遍问题。

WDCD 守约测试 AI模型测试
846 06-10

67.5分三雄并列第一,Grok4仅50分垫底 WDCD守约榜

Claude Sonnet 4.6、Gemini 2.5 Pro与Qwen3 Max以67.5分并列第一,Grok 4与文心一言4.5以50分垫底。R3崩溃率高达65.5%,满分率仅13.6%,头部与尾部在压力测试下差距显著。

WDCD 守约测试 Claude Sonnet
920 06-10

Claude Sonnet 4.6 97.53 分领跑,材料约束把文心一言拉开 40 分

今日 Smoke 评测显示,Claude Sonnet 4.6 以 97.53 分登顶,主榜前三被 Claude 与 Grok 包揽。代码执行 11 模型中 10 个满分,材料约束却把文心一言甩到最后,差距超过 40 分。

Claude Sonnet 4.6 材料约束 Smoke轻量评测
710 06-10

Smoke日报:GPT-5.5 92.58分登顶 材料约束19分差距决定胜负

今日Smoke轻量评测显示,GPT-5.5以92.58分(执行100、约束83.5)继续领跑,豆包Pro紧随其后92.04分。所有前九模型代码执行均满分,排名完全由材料约束拉开,最大差距达19.2分,行业焦点已从“会不会写代码”转向“敢不敢用材料”。

GPT-5.5 材料约束 代码执行满分
749 06-09

11模型同答甩锅题:8个A>B>D>C,3个直接0分

11个模型面对同一道“项目延期甩锅”题,8个给出A>B>D>C并得60分,3个因A>B>C>D得0分。核心差异出现在D与C的顺序判断上,直接反映模型对责任归属的材料约束能力。

execution grounding 工程判断
637 06-08
11 12 13 14 15

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷 XunOPC 不老的告别

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0