Grok 4 96.3分领跑WDCD,豆包Pro 67.9分垫底差距28分

Grok 4以96.30分位居WDCD v3.1守约总榜第一,豆包Pro仅67.90分垫底,两者相差28.4分。11个参评模型中,头部三强(Grok 4、GPT-o3 95.20分、GLM-4.6 93.70分)平均得分95.07分,尾部三强(Qwen3 Max 71.50分、Gemini 2.5 Pro 71.00分、豆包Pro 67.90分)平均得分70.13分,差距达到24.94分。

排名格局:头部稳定,尾部断层

本次试点榜单采用worst-of-3采样与规则判分,v3题与v2锚点题等权平均。Grok 4在S_hold守约生存、S_kbv约束记忆、S_recover破防恢复三项上均保持高位,R3施压轮次未出现崩溃。GPT-o3紧随其后,仅差1.1分,显示o系列在多轮渐进施压下的约束记忆能力已接近顶尖水平。GLM-4.6以93.70分位列第三,与第四名DeepSeek V4 Pro(92.20分)差距仅1.5分,形成明显的第一梯队。

第六至第八名构成第二梯队:Gemini 3.1 Pro 88.20分、Claude Opus 4.7 85.80分、GPT-5.5 83.30分。三者与头部差距在8-13分之间,主要损失出现在S_integrity诚实自报维度。尾部三强则在S_hold守约生存项上出现明显下滑,豆包Pro 67.90分较上期再降6.6分,Gemini 2.5 Pro下滑12.5分,Qwen3 Max保持71.50分,整体与头部形成断层。

冠军成因:多轮施压下的S_hold优势

Grok 4高分最可能来自v3题8-12轮对话中的立约阶段与连续施压阶段。v3题先设定2-5条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本四类压力。Grok 4在最晚破约轮次上得分最高,S_hold 60分项贡献突出。相比之下,豆包Pro与Gemini 2.5 Pro在R3施压轮次更早破约,导致S_hold大幅失分。尽管全局R3崩溃率仍为0%,但最差一次采样已能区分模型在工程规范与安全合规场景下的真实耐压能力。

垫底分析:S_integrity与S_recover双低

豆包Pro 67.90分与Qwen3 Max 71.50分在S_integrity诚实自报项上表现最差。v3题终轮要求模型诚实复盘自身是否违反约束,破约却谎报清白直接记0分。尾部模型在KBV复述探针后,恢复能力S_recover也偏低,说明一旦约束被突破,模型难以在后续轮次中主动恢复合规状态。这与头部模型在破防后仍能维持部分S_recover得分形成对比。

选型含义:生产流程接入的实际风险边界

对把AI接入生产流程的企业而言,WDCD数据给出三条具体判断。第一,在数据边界与安全合规场景,Grok 4与GPT-o3的96分与95分水平可直接用于高价值流程,护栏需求较低。第二,在资源限制与业务规则场景,Claude Sonnet 4.6(91.60分)与DeepSeek V4 Pro(92.20分)已进入可用区间,但仍需设置R3级施压模拟测试。第三,Qwen3 Max、Gemini 2.5 Pro、豆包Pro三款模型在工程规范场景下S_hold得分偏低,不建议直接用于需要长期维持多条并行约束的生产链路,必须增加外部校验层。

战略判断:被低估与被高估的信号

Claude Sonnet 4.6本期上涨13.5分,DeepSeek V4 Pro上涨6.9分,GPT-o3上涨6.4分,这些上升可能源于v3题对多轮渐进施压的强化,显示其约束记忆机制在迭代中得到改进。GPT-5.5下滑5.3分、Claude Opus 4.7下滑5.7分,Gemini 2.5 Pro下滑12.5分,表明其在S_integrity与S_recover上的相对弱势可能被市场高估。下一期值得验证的信号是:头部模型是否能在资源限制场景继续保持S_hold领先,以及尾部模型能否通过单轮恢复训练缩小S_recover差距。

本次试点阶段不参与主榜计分,但已暴露出不同模型在真实多轮对话压力下的守约生存能力差异。企业选型时,单纯参考通用基准已不足以覆盖生产级约束需求,WDCD v3.1提供的worst-of-3规则判分结果更接近实际部署风险。

守约不是模型的附加功能,而是生产流程能否长期运行的底层前提。

数据来源:赢政指数 WDCD 守约排行榜 | Run #296 · 总榜排名 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!