跳到主内容
赢政天下
赢政指数 赢政资讯 AI 专题 Winzheng Lab WDCD
订阅
中文 English 日本語
全部 原创AI新闻 海外精选 AI测评
全部 OpenAI(522) 人工智能(467) Anthropic(397) AI安全(310) AI代理(183) Meta(135) AI伦理(125) AI监管(125) WDCD(122) 谷歌(119) 生成式AI(111) xAI(105) Smoke评测(104) 数据中心(103) 代码执行(99) 网络安全(98) 融资(94) Claude(94) AI(92) AI芯片(91) 材料约束(91)

DeepSeek V4 Pro Smoke评测主榜暴跌16.9分 代码执行单日掉28分

DeepSeek V4 Pro今日Smoke评测主榜从96.99分跌至80.10分,降幅16.9分,主要源于代码执行从100.00分跌至72.00分。材料约束小降3.3分,工程判断反升25分。单日10题抽签下,此类波动需区分题目难度与模型真实变化。

DeepSeek V4 Pro 代码执行 Smoke评测
348 07-13

Claude Opus 4.7主榜跌14分 代码执行从100降至69

Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。

Claude Opus 4.7 代码执行 Smoke评测
256 07-13

Gemini 2.5 Pro以100分居首:2026-07-13 Smoke快测数据简报

2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
255 07-13

WDCD全员正增长:DeepSeek暴涨23.6分 Grok以0.04分险胜

本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。

WDCD 守约测试 模型动态
276 07-12

WDCD横评:安全合规场景最低分仅2.13,Grok-4与Qwen3-Max差距1.73分

WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。

WDCD 守约测试 数据边界
250 07-12

R3 诚信率仅 50.7%:11 模型三轮锚点下的守约崩盘真相

在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。

WDCD 守约测试 三轮衰减
229 07-12

Grok 4 91.40分领跑 WDCD 守约榜 Qwen3 Max 64.88垫底

Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。

WDCD 守约测试 AI模型评估
215 07-12

GLM-4.6材料约束暴跌25分 代码执行反升50分 Smoke测试主榜逆涨

GLM-4.6今日Smoke评测材料约束从50.00分跌至25.00分,降幅25分;代码执行从25.00分升至75.00分,主榜从36.25分升至52.50分。工程判断同步下滑19.5分。单日10题抽样下,需区分题目波动与真实能力变化。

GLM-4.6 材料约束 Smoke评测
407 07-12

Smoke 7天数据:Gemini 2.5 Pro趋势34.3分领涨,GLM-4.6波动40.5分最剧烈

2026-07-08至2026-07-12 Smoke评测显示,Gemini 2.5 Pro趋势上升34.3分至94.24分,豆包Pro上升20.2分至91.99分;GLM-4.6波动达40.5分且诚信评级从fail转为warn,GPT-o3唯一下降3.2分。数据揭示模型一致性差异显著。

Gemini 2.5 Pro GLM-4.6 趋势分析
355 07-12

Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4并列96.99分:2026-07-12 Smoke快测数据简报

2026-07-12 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
281 07-12

Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3并列81.44分:2026-07-11 Smoke快测数据简报

2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
263 07-11

Claude Opus 4.7 Smoke评测主榜暴跌19.3分 代码执行单日掉22分

Claude Opus 4.7今日Smoke评测主榜从90.51分跌至71.26分,下滑19.3分。代码执行从91.50分降至69.50分,材料约束从89.30分降至73.40分,工程判断却升至94.50分。单日10题快测下,此类波动需区分抽签因素与真实能力变化。

Claude Opus 4.7 代码执行 Smoke评测
219 07-10

Grok 4 主榜暴跌 8.4 分,材料约束单日跌 17.6 分

Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 warn。

Grok 4 材料约束 Smoke 评测
232 07-10

GPT-o3以86.9分居首:2026-07-10 Smoke快测数据简报

2026-07-10 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 86.9 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
299 07-10

GPT-o3 材料约束暴跌16.8分,任务表达同步掉28.3分

今日Smoke评测中GPT-o3材料约束从83.60分跌至66.80分,任务表达从95.00分跌至66.70分,主榜整体下滑3.1分至80.39分。代码执行反升8.2分,工程判断持平75.00分,诚信评级维持pass。

GPT-o3 材料约束 Smoke评测
250 07-09

Qwen3 Max材料约束暴跌15.1分 代码执行反升18.4分

Qwen3 Max今日Smoke评测中材料约束从83.60分跌至68.50分,降幅15.1分,代码执行则从73.10分升至91.50分,主榜小幅升至81.15分。单日2题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实能力退化。

Qwen3 Max 材料约束 Smoke评测
210 07-09

Claude Opus 4.7以90.51分居首:2026-07-09 Smoke快测数据简报

2026-07-09 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 90.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
260 07-09

WDCD v3.1:DeepSeek V4 Pro涨26.2分,Claude Sonnet 4.6却跌5.9

本期WDCD v3.1测试中,9个模型得分上升,仅Claude Sonnet 4.6下降5.9分。DeepSeek V4 Pro上涨26.2分至94.00,GLM-4.6上涨21.8分至93.60,Grok 4以95.00继续位居第一。

WDCD 守约测试 模型评估
343 07-08

WDCD v3.1五大场景横评:业务规则1.3分垫底,11模型偏科差距2.1

WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4而qwen3-max仅1.3/4;doubao-pro工程规范与业务规则差距达2.1分。数据边界与安全合规成为高风险区,企业接入生产流程需针对性加护栏。

WDCD 守约测试 业务规则场景
342 07-08

R3诚信率仅61.4%:Claude Sonnet崩盘率20%暴露三轮衰减断层

v2锚点题显示R1确认率95%、R2抵抗率73%、R3诚信率61.4%,Claude Sonnet 4.6 R3崩溃率20%最高,Grok 4与DeepSeek V4 Pro为0。数据仅来自8道v2锚点题,揭示部分模型先确认后崩盘的典型轨迹。

WDCD 守约测试 模型衰减
285 07-08

Grok 4 95分登顶 WDCD 守约榜 Claude Sonnet 4.6 64.1分垫底

Grok 4 以 WDCD 95.00 分位居第一,Claude Sonnet 4.6 以 64.10 分垫底,头部尾部差距 30.9 分。R3 崩溃率仅 4.5%,DeepSeek V4 Pro R3 满分 2.00/2 成关键拉分点。

WDCD 守约测试 守约测试排行榜 Grok 4
210 07-08

DeepSeek V4 Pro以95.19分居首:2026-07-08 Smoke快测数据简报

2026-07-08 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
364 07-08

Claude Opus 4.7 与 Grok 4并列96.99分:2026-07-07 Smoke快测数据简报

2026-07-07 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
298 07-07

豆包 Pro以83.91分居首:2026-07-06 Smoke快测数据简报

2026-07-06 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 83.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
800 07-06

GLM-4.6 材料约束 25 分 代码执行 88.7 分 诚信探针归零

GLM-4.6 在 2026-07-05 Run#214 Smoke 快测中主榜 60.04 分,代码执行 88.70 分、材料约束 25.00 分,诚信评级 fail(探针 0.00)。该模型在 42 个金丝雀探针中全部触发,显示其将虚构实体当作真实引用来源。

GLM-4.6 材料约束 诚信评级
350 07-05

豆包 Pro 与 Gemini 3.1 Pro并列88.54分:2026-07-05 Smoke快测数据简报

2026-07-05 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 与 Gemini 3.1 Pro 以 88.54 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
673 07-05

SGLang 的智能体辅助开发初探

SGLang 团队总结了智能体在高性能推理框架开发中的初步实践:将 CUDA 调试、性能分析、扩散模型接入、基准测试、生产事故复盘等流程沉淀为可执行的 SKILL.md、脚本和评审闭环,让 Agent 不再只写代码,而是按工程协议持续收集证据、验证性能并辅助优化。

LMSYS SGLang Agent开发
402 07-04

Qwen3 Max主榜暴跌12.9分,代码执行单日跌26.8

在赢政指数2026年6月Smoke评测中,Qwen3 Max主榜从84.92分跌至72.02分,代码执行维度从96.30分暴跌至69.50分,降幅达26.8分,材料约束则小幅上升4.1分。

Qwen3 Max 代码执行 Smoke评测
327 07-04

Qwen3 Max主榜暴跌12.9分 Gemini 2.5 Pro 96.99分领跑Smoke轻量榜

2026-07-04 Smoke轻量评测中,Gemini 2.5 Pro以主榜96.99分(执行100、约束93.3)登顶,Qwen3 Max主榜暴跌12.9分至72.02。GPT-o3与Gemini 2.5 Pro单日分别上涨24分和22.4分,执行与约束的强弱搭配成为今日核心分化点。

Gemini 2.5 Pro Qwen3 Max Smoke评测
325 07-04

WDCD横评:业务规则场景最低1.55分 grok-4安全合规3.86夺冠

WDCD v3.1五大约束场景横评显示,业务规则场景全体得分最低,doubao-pro与qwen3-max仅1.55/4垫底;grok-4在安全合规拿下3.86/4最高分,同时在全部场景保持第一;Claude-sonnet-4.6工程规范与业务规则差距达1.76分,偏科最严重。

WDCD 守约测试 业务规则
348 07-03
2 3 4 5 6

© 1998-2026 赢政天下 版权所有

始于 1998,再启航于 2025。从技术社区到 AI 模型评测,我们一直在做一件事:把复杂的东西讲清楚。

赢政指数 赢政资讯 Winzheng Lab 关于我们 订阅更新 隐私政策 服务条款
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷

本评测独立运营,不接受 AI 模型厂商赞助。赢政指数的每一分都是系统跑出来的。

引用格式:赢政指数 (2026). AI 模型综合排名. https://www.winzheng.com/yz-index/

数据授权:CC BY-NC 4.0