11模型WDCD三轮锚点:R3诚信率仅45.5%,Qwen3 Max与Claude Sonnet对决
v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施压下的真实差异。
v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施压下的真实差异。
Grok 4 以 93.80 分位居 WDCD v3.1 守约榜首,GLM-4.6 以 68.00 分垫底。11 个模型中 R3 崩溃率 9.1%,满分率 48.2%。头部与尾部差距主要体现在 R3 施压阶段的约束维持能力上。
Claude Sonnet 4.6今日Smoke评测中材料约束从100.00跌至66.40,主榜从86.25降至81.86。代码执行反升19.5分至94.50,工程判断下滑17.5分。单日10题抽签下,材料约束大幅波动值得持续观察。
Grok 4在今日Smoke评测中材料约束从100.00跌至82.20,代码执行从75.00升至93.50,主榜从86.25升至88.42。单日10题快测下,材料约束-17.8分的跌幅与代码执行+18.5分的涨幅形成明显反差,工程判断小降2.8分,任务表达小升4.1分。
2026-09-09 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 89.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,需判断是抽签波动还是真实能力退化。
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50分。单日10题测试下,维度分数剧烈波动,需判断是否为抽签波动还是真实退化。
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦资源限制与安全合规场景下的逐轮衰减规律及生产选型风险。
Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。
2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测材料约束从74.30分跌至53.30分(-21),代码执行从50.00升至75.00(+25),主榜从60.94升至65.24(+4.3),工程判断从25.00升至95.80,诚信评级从pass变为warn。单日10题抽签波动与真实退化需区分。
Qwen3 Max今日Smoke评测中代码执行从96.70分跌至75.00分,材料约束从48.80分升至69.20分,主榜从75.15分降至72.39分,诚信评级由pass转为warn。单日维度剧烈波动但整体影响有限。
2026-09-05 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 90.64 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测主榜从48.25升至60.94,材料约束从46.10升至74.30,工程判断从64.60跌至25.00,任务表达从50.00跌至25.00,诚信评级从fail升至pass。单日10题抽签导致侧榜剧烈波动,主榜改善主要来自材料约束。
GPT-5.5今日Smoke评测代码执行从100.00跌至75.00,主榜从79.12降至71.67。材料约束反升14分至67.60,工程判断同步跌25分。单日10题抽样导致的波动与模型真实退化需区分判断。
2026-09-04 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-03 Run#307 中 GLM-4.6 诚信评级 fail,探针得分仅 15.00,主榜 48.25 分,代码执行 50.00,材料约束 46.10。其余 10 款模型全部 pass,探针得分 80-100。
2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。
安全合规场景全体得分最低,qwen3-max仅2/4,deepseek-v4-pro仅2.5/4;数据边界多模型4/4;deepseek-v4-pro业务规则4/4却安全合规2.5/4,差距1.5分。企业接入生产流程时需按场景加护栏。
WDCD v3.1试点中,8道v2锚点题显示R1确认率100%、R2抵抗率73%、R3诚信率72.7%,110次采样中3次R3完全崩溃。GLM-4.6、DeepSeek V4 Pro、Qwen3 Max在安全合规多约束场景下先确认后崩盘,Gemini 3.1 Pro等8模型全程维持满分。
Gemini 3.1 Pro以97.70分位居WDCD v3.1守约榜首位,Qwen3 Max 70.30分垫底,11模型中满分率68.2%,R3崩溃率仅2.7%。头部与尾部在R3施压阶段差距达2.00分,生产接入需重点关注安全合规场景。
2026-09-02 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 95.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
今日Smoke评测中GPT-5.5代码执行从94.50跌至69.50,材料约束从76.00升至100.00,主榜从86.18降至83.23。单日10题快测下,执行维度暴跌与约束维度暴涨形成对冲,需区分抽签波动与真实退化。
Grok 4今日Smoke评测代码执行从94.50分跌至72.70分,材料约束升至100.00分,主榜下滑4.2分至84.99分。工程判断与任务表达均有提升,诚信评级维持pass。分析显示小样本题目抽签是主要波动来源。
2026-09-01 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。