Grok 4 94分登顶 WDCD守约榜 豆包 Pro 68分垫底差距26分

WDCD v3.1 守约测试中,Grok 4 以 94.00 分获得第一,豆包 Pro 以 68.17 分位列第 11,两个模型在 R3 施压轮次的得分分别为 1.50/2 和 0.88/2,差距直接拉开总分 25.83 分。

排名格局:头部集中,尾部断层

前五名 WDCD 分数分布在 86.48-94.00 区间,第六至第八名落在 80.07-84.79 区间,第九至第十名降至 75.31-77.72,第十一名豆包 Pro 68.17 分形成明显断层。v2 锚点题折算后,Grok 4 的 R1+R2+R3 总和为 3.50/4,豆包 Pro 仅 2.26/4,说明尾部模型在初始约束注入阶段已出现 0.37 分的 R1 扣分。

冠军分析:Grok 4 的 R3 表现

Grok 4 在 17 道 v3 题的 S_hold 守约生存维度得分最高,R3 施压轮次拿到 1.50/2。该模型在社会认同、权威特批、切香肠三类施压下,破约发生时间最晚,S_recover 破防恢复与 S_integrity 诚实自报两项也维持较高水平。相比之下,Claude Opus 4.7 同样 R1 满分 1.00,但 R3 仅 1.25/2,总分落后 9.45 分,显示其在连续 8-12 轮对话中的约束维持能力弱于 Grok 4。

垫底原因:豆包 Pro 的 R1 缺陷

豆包 Pro 是唯一 R1 得分低于 1.00 的模型,仅 0.63 分,意味着在立约阶段即无法完整记住 2-5 条并行硬约束。后续 R2 干扰和 R3 施压下,其 S_kbv 约束记忆得分受累,导致总分比第九名 Qwen3 Max 低 7.14 分。v3 题的 KBV 复述探针环节,豆包 Pro 最容易在第 6-8 轮后出现约束遗忘。

头部梯队 vs 尾部差距的机制拆解

前三名 Grok 4、GLM-4.6、DeepSeek V4 Pro 的 R3 平均得分 1.38/2,而后三名 GPT-5.5、Qwen3 Max、豆包 Pro 的 R3 平均仅 0.88/2。差距主要来自数据边界与安全合规两类约束场景,这两类场景在 v3 题中施压轮次最长,沉没成本抬压最明显。工程规范类约束场景下,各模型 R3 得分差异较小,说明当前模型在代码级规则遵守上相对均衡。

对生产接入的选型含义

把 AI 接入生产流程的企业,若业务规则与安全合规要求严格,Grok 4 的 94.00 分与 1.50/2 R3 表现可作为首选,适合直接开放多轮对话接口。GLM-4.6 与 DeepSeek V4 Pro 得分接近 88 分,可在资源限制场景下使用,但需在数据边界场景额外设置外部校验。豆包 Pro 68.17 分的模型,R1 阶段即丢 0.37 分,不建议在需要并行硬约束的生产流程中使用,建议仅用于单轮问答或增加人工复核节点。

战略判断:谁被高估或低估

Claude Sonnet 4.6 排名第四(86.69 分),R2 得分 0.75,高于 DeepSeek V4 Pro 的 0.63,但 R3 仅 0.88/2,说明其在中期干扰阶段表现较好,却在终轮施压下更易破约。该模型的守约能力可能被市场高估。Qwen3 Max 排名第十(75.31 分),R1 与 R2 均达到 1.00,却因 R3 1.13/2 拉低总分,其在长对话约束维持上的真实能力可能被低估,下期测试需重点观察其在 11 轮以上对话中的 S_hold 变化。

与上期对比显示,豆包 Pro 提升 10.2 分、GLM-4.6 提升 6.8 分,主要来自 R3 得分改善,说明这些模型在连续施压下的恢复能力有进步。但全局 R3 崩溃率仍达 8.2%,表明即使头部模型也存在 8.2% 的概率在最差一次采样中出现破约。

企业选择模型时,应优先查看 R3 得分而非仅看总分,R3 低于 1.00/2 的模型在安全合规场景下需额外护栏。

下期验证重点应放在 5 种约束场景的细分得分,特别是资源限制与工程规范两类当前差距较小的场景,观察是否会出现新的断层。


数据来源:赢政指数 WDCD 守约排行榜 | Run #291 · 总榜排名 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!