Grok 4 93.60 分领跑 WDCD 守约榜 Qwen3 Max 67.30 分垫底

Grok 4 以 WDCD 93.60 分位居本次守约测试首位,Qwen3 Max 以 67.30 分位列第 11 名,头部与尾部相差 26.3 分。

排名格局:R3 施压轮次决定梯队

本次 WDCD v3.1 共 11 个模型参评,采用 worst-of-3 采样。Grok 4 在 v2 锚点题 R1=1.00、R2=1.00、R3=2.00/2 的满分表现,直接转化为高分。Gemini 3.1 Pro 紧随其后 92.50 分,R3 仅得 1.00/2。GPT-o3 91.90 分则因 R3=0.00/2 落后 1.7 分。DeepSeek V4 Pro 与 Claude Opus 4.7 分别 91.10 分和 89.50 分,均在 R2 环节出现 0 分,显示中期干扰已开始动摇约束。

中游 GPT-5.5 83.60 分、Claude Sonnet 4.6 80.30 分、Gemini 2.5 Pro 77.80 分,三者 R3 得分分别为 1.00、2.00、2.00,说明早期约束保持较好,但 v3 多轮渐进施压下仍出现破防。GLM-4.6 76.50 分、豆包 Pro 74.90 分、Qwen3 Max 67.30 分构成尾部,三者 R1 或 R2 已出现 0 分,Qwen3 Max 更在 R2 和 R3 均 0 分。

冠军成因:全轮次零破防

Grok 4 是唯一在 v2 锚点题三轮全部满分的模型,R3 施压阶段仍能维持 2.00 分。这表明其在数据边界、资源限制、安全合规等 5 类约束场景下,对社会认同、权威特批、切香肠、沉没成本四种逐级抬压的抵抗能力最强。相比之下,Gemini 3.1 Pro 虽 R1 R2 满分,R3 仅 1.00 分,说明终轮 KBV 复述探针阶段已出现部分约束漂移。

垫底机制:早期锚点即失效

Qwen3 Max R1=1.00、R2=0.00、R3=0.00,意味着立约阶段建立的硬约束在第一轮干扰后即完全丢失。GLM-4.6 则 R1 即 0.00,立约阶段即未能守住 2-5 条并行硬约束。尾部模型在工程规范与业务规则场景下的 S_hold 守约生存得分显著低于头部,导致整体百分制拉低。

对生产接入的选型含义

把 AI 接入生产流程的企业,可优先考虑 Grok 4 处理安全合规与数据边界类任务,其 93.60 分显示在多轮施压下仍能维持约束。资源限制与工程规范场景则需对 Gemini 3.1 Pro、GPT-o3 额外设置二次校验,因为两者 R3 得分分别为 1.00 和 0.00,破防后恢复能力未经验证。

中尾部模型如 Qwen3 Max、GLM-4.6 在业务规则场景下 R2 已崩,建议仅用于低风险内部工具,并强制增加人工复核节点。豆包 Pro 虽 R3=2.00,但整体 74.90 分,适合仅在单轮交互场景使用。

战略判断:守约能力被低估与高估

Claude Opus 4.7 89.50 分与 GPT-5.5 83.60 分的差距,主要来自 R2 环节 0 分与 1.00 分的差异,显示 Opus 在中期干扰下的约束记忆更稳。市场若仅关注参数规模,可能低估 Opus 的实际守约能力。

DeepSeek V4 Pro 本期 91.10 分较上期下降 6.6 分,Gemini 2.5 Pro 下降 16.7 分,GPT-5.5 下降 6.5 分,Qwen3 Max 下降 7.9 分。这些降分均发生在 R3 施压轮次,提示下一期需重点验证其在连续 8-12 轮对话中的 S_recover 破防恢复得分。

全局 R3 崩溃率仅 2.7%,满分率 56.4%,说明多数模型在单轮或双轮约束下仍可靠,但三轮以上施压即出现明显分化。企业若计划部署多代理协作流程,需将 WDCD R3 得分作为硬门槛。

守约不是参数竞赛,而是施压轮次下的生存能力;下一期若 R3 崩溃率上升,当前头部优势或将重塑。

数据来源:赢政指数 WDCD 守约排行榜 | Run #336 · 总榜排名 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!