本期WDCD v3.1试点中,Grok 4以94.20分位居首位,Claude Opus 4.7与Gemini 3.1 Pro分别较Run #242下降5.9分和5.6分,其余9个参评模型未出现上升,Top5后三名分数均落在83分区间。
数据事实:仅两模型出现明显下滑
本次采样采用worst-of-3口径,11个模型在25道题池上得分经等权平均后,Grok 4 WDCD=94.20,DeepSeek V4 Pro WDCD=87.04,GLM-4.6 WDCD=83.92,Claude Opus 4.7 WDCD=83.52,Gemini 3.1 Pro WDCD=83.28。Claude Opus 4.7与Gemini 3.1 Pro的降幅超过5分,直接使其从潜在更高区间回落至83分段,与第三名GLM-4.6的差距缩小至0.4分以内。
成因分析:v3多轮施压下的S_hold差异
WDCD v3题设计包含8-12轮对话,先立约2-5条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本等逐级压力,最后经KBV复述探针与终轮诚实复盘计分。S_hold权重60分,破约越晚得分越高。Claude Opus 4.7与Gemini 3.1 Pro本次降分,最可能出现在连续施压阶段的R3-R6轮次,尤其在安全合规与数据边界两类约束场景下,模型更早放弃初始约束,导致S_hold分值下降。v2三轮锚点题的R3施压部分同样计2分,这部分得分降低会直接拉低折算百分制。相比之下,Grok 4在相同worst-of-3采样下仍维持94.20分,显示其在沉没成本抬压阶段的约束保留能力更强。
选型含义:生产流程接入时的护栏需求
对把AI接入生产流程的企业而言,WDCD分数直接反映模型在业务规则与工程规范约束下的持久性。Grok 4 94.20分意味着在需要连续多轮执行固定数据边界或资源限制的场景中,可减少额外提示词重申的频率。Claude Opus 4.7与Gemini 3.1 Pro降至83分区间后,在安全合规类任务中更易在第5-7轮出现约束漂移,企业需在这些模型前端增加独立约束校验层,或限制对话轮次上限。DeepSeek V4 Pro 87.04分与GLM-4.6 83.92分则处于中间带,适合对S_recover恢复能力要求不高的内部工具场景,但仍需在关键节点设置人工复核。
战略判断:守约能力被低估与高估的信号
从本期数据可推断,Grok 4的守约能力在当前榜单中被市场低估,其94.20分与第二名相差7.16分,差距主要来自v3题的S_hold与S_integrity两项。Claude Opus 4.7此前可能因单轮表现被高估,本次5.9分下滑显示其在连续权威特批施压下的破防点更早。下一期需重点验证两模型在资源限制场景下的R4-R5轮次表现,若Claude Opus 4.7的S_kbv约束记忆分仍低于平均,则其在长流程业务规则场景中的适用性将进一步受限。
守约能力不是模型参数的附属品,而是生产环境中可量化的风险对冲指标。
本次试点仅记录分数变化,未纳入主榜。企业选型时应将WDCD分数与具体约束场景匹配,而非仅看总体排名。
数据来源:赢政指数 WDCD 守约排行榜 | Run #247 · 变化追踪 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接