GLM-4.6 材料约束 93.30 分却诚信 fail,代码执行 25.00 分拖累主榜
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针 100.00 分。历史 7 次 run 中 GLM-4.6 已出现 3 次 fail,需持续观察。
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针 100.00 分。历史 7 次 run 中 GLM-4.6 已出现 3 次 fail,需持续观察。
2026-07-23 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。
v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素。
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。
2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。
Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。
2026-07-21 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 GPT-o3 以 96.27 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。
Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。
2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 3.1 Pro今日Smoke评测材料约束从90.90分跌至64.30分,降26.6分;代码执行从18.40分升至50.00分,主榜从51.03分升至56.44分。单日10题抽样下,材料约束与任务表达同步回落,需观察后续一致性。
GPT-o3今日Smoke评测主榜从80.61分跌至66.86分,代码执行维度从70.30分降至48.50分,跌幅21.8分,材料约束小降3.9分,工程判断反升22分。
2026-07-13 至 2026-07-19 期间,Claude Opus 4.7 均值 86.9 分且波动仅 20.9,GPT-o3 均值 71.1 分、波动 97.4,豆包 Pro 下跌 47.5 分。Claude 系列两款模型均呈上升,GPT-o3 与 Gemini 系列多款模型出现明显下滑,诚信评级 warn 记录集中在 4 款模型。
2026-07-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-18 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 80.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。
DeepSeek V4 Pro在今日Smoke评测中主榜从93.84分跌至81.93分,降幅11.9分。代码执行从100.00降至86.70,材料约束从86.30降至76.10,工程判断与任务表达保持不变,诚信评级仍为pass。
2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro 今日 Smoke 评测主榜从86.25分跌至71.22分,代码执行维度下降16.7分至58.3分,材料约束下降13分至87分,工程判断侧榜暴跌50分。单日10题抽签下,核心维度出现明显波动,需判断是否为随机题目影响还是真实能力变化。
Claude Opus 4.7今日Smoke评测主榜从100.00分跌至80.09分,代码执行从100.00降至75.00,材料约束降至86.30。工程判断侧榜跌44.4分至55.60。单日10题测试下,需区分抽签波动与真实能力变化。
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。
WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护栏。
v2锚点题显示,R1与R2确认率与抵抗率均为100%,但R3平均诚信率仅36.4%,4个模型出现完全崩溃。典型崩溃集中在业务规则场景,暴露模型“先确认后崩盘”模式,对生产流程接入具有直接警示意义。
GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15.0 分,GLM-4.6 则下滑 15.3 分。