跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(510) 人工智能(457) Anthropic(390) AI安全(295) AI代理(179) Meta(133) AI伦理(124) AI监管(124) WDCD(117) 谷歌(116) 生成式AI(109) xAI(105) Smoke评测(101) 数据中心(100) 代码执行(99) 融资(93) Claude(93) AI(92) AI芯片(90) 网络安全(90) 材料约束(89)

Claude Opus 4.7以100分居首:2026-07-20 Smoke快测数据简报

2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
204 07-20

Gemini 3.1 Pro 材料约束跌26.6分 主榜仍升5.4分

Gemini 3.1 Pro今日Smoke评测材料约束从90.90分跌至64.30分,降26.6分;代码执行从18.40分升至50.00分,主榜从51.03分升至56.44分。单日10题抽样下,材料约束与任务表达同步回落,需观察后续一致性。

Gemini 3.1 Pro 材料约束 Smoke评测
161 07-19

GPT-o3主榜暴跌13.8分 代码执行从70.3直降48.5

GPT-o3今日Smoke评测主榜从80.61分跌至66.86分,代码执行维度从70.30分降至48.50分,跌幅21.8分,材料约束小降3.9分,工程判断反升22分。

GPT-o3 代码执行 Smoke评测
185 07-19

Claude Opus 4.7 均值 86.9 分领跑 GPT-o3 7 天下跌 30.5 分

2026-07-13 至 2026-07-19 期间,Claude Opus 4.7 均值 86.9 分且波动仅 20.9,GPT-o3 均值 71.1 分、波动 97.4,豆包 Pro 下跌 47.5 分。Claude 系列两款模型均呈上升,GPT-o3 与 Gemini 系列多款模型出现明显下滑,诚信评级 warn 记录集中在 4 款模型。

Claude Opus 4.7 GPT-o3 Smoke 周趋势
145 07-19

Claude Opus 4.7以95.19分居首:2026-07-19 Smoke快测数据简报

2026-07-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
258 07-19

GPT-o3以80.61分居首:2026-07-18 Smoke快测数据简报

2026-07-18 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 80.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
251 07-18

Grok 4 Smoke评测主榜暴跌17.5分 材料约束单日跌21.9

Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。

Grok 4 材料约束 Smoke评测
184 07-17

DeepSeek V4 Pro主榜暴跌11.9分 代码执行掉13.3

DeepSeek V4 Pro在今日Smoke评测中主榜从93.84分跌至81.93分,降幅11.9分。代码执行从100.00降至86.70,材料约束从86.30降至76.10,工程判断与任务表达保持不变,诚信评级仍为pass。

DeepSeek V4 Pro 代码执行 Smoke评测
184 07-17

Gemini 2.5 Pro 与 Gemini 3.1 Pro并列92.44分:2026-07-17 Smoke快测数据简报

2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
259 07-17

豆包 Pro 主榜暴跌15分:代码执行从75直降58.3

豆包 Pro 今日 Smoke 评测主榜从86.25分跌至71.22分,代码执行维度下降16.7分至58.3分,材料约束下降13分至87分,工程判断侧榜暴跌50分。单日10题抽签下,核心维度出现明显波动,需判断是否为随机题目影响还是真实能力变化。

豆包 Pro 代码执行 Smoke评测
167 07-16

Claude Opus 4.7主榜暴跌19.9分 代码执行单日跌25分

Claude Opus 4.7今日Smoke评测主榜从100.00分跌至80.09分,代码执行从100.00降至75.00,材料约束降至86.30。工程判断侧榜跌44.4分至55.60。单日10题测试下,需区分抽签波动与真实能力变化。

Claude Opus 4.7 代码执行 Smoke评测
133 07-16

Grok 4以94.15分居首:2026-07-16 Smoke快测数据简报

2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
397 07-16

Claude Sonnet 4.6 暴涨15分 GLM-4.6 暴跌15.3 WDCD守约两极分化

本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。

WDCD 守约测试 Claude Sonnet 4.6
156 07-15

业务规则成WDCD最大短板,qwen3-max 1.55分 vs deepseek 4分

WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护栏。

WDCD 守约测试 业务规则
154 07-15

R3施压后36.4%诚信率:4模型零分崩盘WDCD守约真相

v2锚点题显示,R1与R2确认率与抵抗率均为100%,但R3平均诚信率仅36.4%,4个模型出现完全崩溃。典型崩溃集中在业务规则场景,暴露模型“先确认后崩盘”模式,对生产流程接入具有直接警示意义。

WDCD 守约测试 约束衰减
153 07-15

WDCD守约榜 GPT-o3 94分夺冠 Qwen3 Max 62.6分垫底

GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15.0 分,GLM-4.6 则下滑 15.3 分。

WDCD 守约测试 模型排行榜
116 07-15

Gemini 3.1 Pro Smoke 评测主榜暴跌 8.5 分,代码执行从 75 直接腰斩

Gemini 3.1 Pro 今日 Smoke 评测主榜从 80.99 分跌至 72.50 分,降幅 8.5 分。其中代码执行维度从 75.00 分腰斩至 50.00 分,材料约束反而升至 100.00 分,工程判断(侧榜,AI 辅助评估)从 100.00 分跌至 75.00 分。

Gemini 3.1 Pro 代码执行 Smoke 评测
132 07-15

DeepSeek V4 Pro代码执行暴跌23.7分 主榜下滑5.2点

DeepSeek V4 Pro今日Smoke评测代码执行从98.70分跌至75.00分,降幅23.7分,主榜从91.46分降至86.25分。材料约束却从82.60分升至100.00分,工程判断下滑11.1分。单日10题抽签导致的波动可能性高于模型真实退化。

DeepSeek V4 Pro 代码执行 Smoke评测
113 07-15

Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5并列100分:2026-07-15 Smoke快测数据简报

2026-07-15 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
287 07-15

DeepSeek V4 Pro以91.46分居首:2026-07-14 Smoke快测数据简报

2026-07-14 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 91.46 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
296 07-14

DeepSeek V4 Pro Smoke评测主榜暴跌16.9分 代码执行单日掉28分

DeepSeek V4 Pro今日Smoke评测主榜从96.99分跌至80.10分,降幅16.9分,主要源于代码执行从100.00分跌至72.00分。材料约束小降3.3分,工程判断反升25分。单日10题抽签下,此类波动需区分题目难度与模型真实变化。

DeepSeek V4 Pro 代码执行 Smoke评测
332 07-13

Claude Opus 4.7主榜跌14分 代码执行从100降至69

Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。

Claude Opus 4.7 代码执行 Smoke评测
236 07-13

Gemini 2.5 Pro以100分居首:2026-07-13 Smoke快测数据简报

2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
250 07-13

WDCD全员正增长:DeepSeek暴涨23.6分 Grok以0.04分险胜

本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。

WDCD 守约测试 模型动态
244 07-12

WDCD横评:安全合规场景最低分仅2.13,Grok-4与Qwen3-Max差距1.73分

WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。

WDCD 守约测试 数据边界
214 07-12

R3 诚信率仅 50.7%:11 模型三轮锚点下的守约崩盘真相

在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。

WDCD 守约测试 三轮衰减
188 07-12

Grok 4 91.40分领跑 WDCD 守约榜 Qwen3 Max 64.88垫底

Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。

WDCD 守约测试 AI模型评估
183 07-12

GLM-4.6材料约束暴跌25分 代码执行反升50分 Smoke测试主榜逆涨

GLM-4.6今日Smoke评测材料约束从50.00分跌至25.00分,降幅25分;代码执行从25.00分升至75.00分,主榜从36.25分升至52.50分。工程判断同步下滑19.5分。单日10题抽样下,需区分题目波动与真实能力变化。

GLM-4.6 材料约束 Smoke评测
391 07-12

Smoke 7天数据:Gemini 2.5 Pro趋势34.3分领涨,GLM-4.6波动40.5分最剧烈

2026-07-08至2026-07-12 Smoke评测显示,Gemini 2.5 Pro趋势上升34.3分至94.24分,豆包Pro上升20.2分至91.99分;GLM-4.6波动达40.5分且诚信评级从fail转为warn,GPT-o3唯一下降3.2分。数据揭示模型一致性差异显著。

Gemini 2.5 Pro GLM-4.6 趋势分析
343 07-12

Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4并列96.99分:2026-07-12 Smoke快测数据简报

2026-07-12 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
278 07-12
1 2 3 4 5

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0