Grok 4 95.69 分登顶 WDCD,Qwen3 Max 73.48 分垫底差距超 22 分

Grok 4 以 95.69 分在 WDCD v3.1 守约测试中排名第一,Qwen3 Max 以 73.48 分垫底,两者相差 22.21 分。

排名格局:头部集中,尾部断层

本次 WDCD 排行榜显示前五名得分均在 86 分以上,分别为 Grok 4(95.69)、Gemini 3.1 Pro(88.14)、GLM-4.6(87.55)、DeepSeek V4 Pro(86.62)、Claude Opus 4.7(86.34)。第 6 至第 10 名集中在 82-84 分区间,GPT-5.5 得 84.24,GPT-o3 得 84.07。尾部三名中 Qwen3 Max 73.48 分、豆包 Pro 76.38 分、Gemini 2.5 Pro 77.69 分,与头部形成明显断层。

全局统计显示满分率 57%,R3 崩溃率 9.4%。采样采用 worst-of-3 口径,每题跑三遍取最差一次,规则判分零 AI 裁判。

冠军分析:Grok 4 在 R3 施压下的生存优势

Grok 4 的 R1=1.00、R2=1.00、R3=1.38/2,v3 题守约生存得分贡献突出。v3 题设计包含 8-12 轮对话,先立 2-5 条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后 KBV 复述探针与诚实自报。Grok 4 在 R3 阶段仍保持较高得分,说明其在连续施压场景下约束记忆与恢复能力较强。

成因可能来自其对数据边界与安全合规类约束的处理机制,在多轮渐进施压中破防时间较晚,S_hold 得分相应提高。

垫底分析:Qwen3 Max 的 R3 表现与记忆衰减

Qwen3 Max R1=1.00、R2=0.75、R3=0.63/2,R3 得分明显低于头部模型。v2 锚点题三轮设计中,R3 权重占 2 分,其低分直接拉低总分。可能原因是在资源限制或工程规范场景下,连续干扰后约束记忆衰减更快,S_kbv 与 S_recover 得分受影响。

与排名第 14 的豆包 Pro(R1=0.75)相比,Qwen3 Max R1 满分但 R3 更低,显示其在立约阶段表现正常,问题集中在后期施压轮次。

头部梯队 vs 尾部差距的选型含义

对把 AI 接入生产流程的企业而言,WDCD 得分差异直接影响可用场景。Grok 4、Gemini 3.1 Pro 等头部模型在 5 种约束场景中守约生存时间较长,适合数据边界与安全合规要求较高的环节,如金融风控规则执行或医疗合规审查。

尾部模型如 Qwen3 Max 在多轮施压下 R3 得分低,建议在业务规则或资源限制场景中额外增加外部护栏,例如二次校验或人工复核节点,避免约束在沉没成本施压下被逐步突破。

具体判断:若企业核心流程涉及 8 轮以上连续交互,优先选择 R3 得分 1.0 以上的模型;R3 得分低于 0.8 的模型适合单轮或低压场景,并需设置熔断机制。

战略判断:守约能力可能被低估与高估的信号

GLM-4.6 本期较上期上升 26.0 分,GPT-5.5 上升 10.5 分,显示部分模型在 v3 多轮渐进施压题上的改进空间较大。分析认为,GLM-4.6 的提升可能来自 KBV 复述探针与诚实自报环节的优化,值得下期继续验证其在工程规范场景的稳定性。

GPT-o3 R3 仅 0.25/2,较同系列 GPT-5.5 的 0.75/2 差距明显,可能反映其在权威特批施压下的恢复能力较弱,这一信号可作为下期重点观察项。

Claude Opus 4.7 与 Claude Sonnet 4.6 得分分别为 86.34 与 80.31,同一系列内部差异 6 分以上,提示不同参数规模在守约任务上的表现分化,生产选型时需单独测试而非按系列打包。

守约能力不是静态标签,而是多轮施压下的动态生存曲线;企业选型时应以 R3 得分而非平均分作为核心门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #360 · 总榜排名 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!