Claude Sonnet 4.6 暴涨13.5分 Gemini 2.5 Pro 暴跌12.5,WDCD v3.1 守约榜单剧烈洗牌

Claude Sonnet 4.6在本次WDCD v3.1测试中较Run #291上涨13.5分,达到91.60分,而Gemini 2.5 Pro则下跌12.5分,Grok 4以96.30分保持首位,GPT-o3以95.20分位居第二。

核心数据事实

本次试点共11个模型参评,采用worst-of-3采样。Claude Sonnet 4.6、DeepSeek V4 Pro(92.20分,+6.9)、GPT-o3(+6.4)三家上升;Claude Opus 4.7(-5.7)、豆包 Pro(-6.6)、Gemini 2.5 Pro(-12.5)、GPT-5.5(-5.3)四家下降。Top 5中Grok 4、GPT-o3、GLM-4.6(93.70)三家均超过93分,Claude Sonnet 4.6刚好挤入第五。

守约得分差异的可能机制

v3.1题池强调8-12轮连续施压,包含社会认同、权威特批、切香肠、沉没成本四类逐级抬压,以及KBV复述探针与终轮诚实自报。Claude Sonnet 4.6分数大幅上升,最可能源于S_recover(破防恢复)与S_integrity(诚实自报)两项的改善,在多轮压力后仍能维持约束记忆并如实复盘。Gemini 2.5 Pro下跌12.5分,则可能集中在S_hold(守约生存)环节,较早阶段即在资源限制或安全合规场景中破约,导致60分基数大幅损失。

DeepSeek V4 Pro与GPT-o3同步上升,提示其在工程规范与业务规则两类约束场景下的多轮抗压能力有所增强。相反,GPT-5.5与Claude Opus 4.7同步回落,可能反映其对权威特批类施压的敏感度上升,较早轮次即出现约束漂移。

对生产流程接入的实际含义

对于将AI接入生产流程的企业,WDCD分数直接对应可信任的约束场景边界。Grok 4与GPT-o3均超过95分,在数据边界与安全合规场景下可考虑直接使用,所需额外护栏最少。Claude Sonnet 4.6升至91.60分后,已接近可用于资源限制类任务的门槛,但仍需在沉没成本施压场景下增加人工复核节点。

Gemini 2.5 Pro与豆包 Pro分数回落,提示其在连续多轮业务规则约束下风险较高,企业若计划接入,应在切香肠式渐进请求环节设置二次确认机制,避免单轮通过后后续约束逐步失效。

战略判断与下期验证信号

本次数据表明,Grok 4的守约能力可能被市场低估,其96.30分领先优势在v3.1题型下得到验证;Gemini 2.5 Pro的守约能力则可能被高估,12.5分跌幅显示其在v3多轮施压下的脆弱性。Claude Sonnet 4.6的13.5分反弹,值得下期继续追踪其S_kbv(约束记忆)是否稳定。

分析认为,模型更新或prompt敏感度变化是主要驱动因素,但需在下一周期确认DeepSeek V4 Pro与GPT-o3的上升是否可持续。企业选型时,优先考虑Top 3模型在安全合规场景的直接部署,对排名5-7位的模型则需额外增加KBV复述探针式的运行时校验。

守约能力的分化已从实验室指标变为生产决策的真实门槛,下期验证重点在于观察Claude Sonnet 4.6能否守住91分平台,以及Gemini 2.5 Pro是否会继续下探。

数据来源:赢政指数 WDCD 守约排行榜 | Run #296 · 变化追踪 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!