WDCD v3.1 试点中,Gemini 2.5 Pro 较 Run #331 下降16.7分,四家参评模型中降幅最大,DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6分、6.5分、7.9分,本期无模型得分上升。
数据事实:仅四模型下滑的分布特征
本次采样覆盖11个模型,采用worst-of-3口径。Gemini 2.5 Pro 的16.7分跌幅远超其他三家,DeepSeek V4 Pro 从Run #331的97.7分区间回落至91.10分,GPT-5.5与Qwen3 Max 跌幅集中在6.5-7.9分区间。Top 5榜单显示Grok 4以93.60分位列第一,Gemini 3.1 Pro 92.50分紧随其后,GPT-o3 91.90分、DeepSeek V4 Pro 91.10分、Claude Opus 4.7 89.50分。
成因分析:v3多轮施压下的约束失效路径
v3题设计包含8-12轮对话,先立约2-5条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后进行KBV复述探针与诚实自报。Gemini 2.5 Pro 16.7分的大幅回落,最可能出现在R3-R6的连续施压阶段,即“切香肠”与“沉没成本”叠加的轮次。S_hold守约生存分(权重60)对破约时机敏感,若在第5-7轮即出现约束松动,会直接拉低该项得分。
DeepSeek V4 Pro 与Qwen3 Max 的6-8分回落,则更可能集中在S_kbv约束记忆(权重15)与S_recover破防恢复(权重10)两项。v2锚点题的三轮设计显示,R2干扰与R3施压后,这两家模型的KBV复述准确率下降,导致折算百分制得分被拉低。GPT-5.5的6.5分下滑幅度最小,或许仅在工程规范类约束场景下出现S_integrity诚实自报扣分。
选型含义:生产流程接入时的护栏优先级
把AI接入生产流程的企业需区分约束场景。对于安全合规与数据边界类硬约束,Gemini 2.5 Pro 当前91分区间表现已低于Grok 4的93.60分,建议在RAG前置增加二次校验节点,避免在第5轮后的用户追问中出现越权输出。资源限制与业务规则场景下,DeepSeek V4 Pro 91.10分仍可使用,但需在提示层追加“每轮复述已立约束”指令,将S_kbv权重损失控制在5分以内。
工程规范类任务可优先考虑Grok 4,其93.60分在worst-of-3口径下显示出更稳定的S_hold与S_recover组合,适合长上下文多轮交互的代码审查流程。Claude Opus 4.7的89.50分则提示,在沉没成本施压明显的客服升级场景中,需额外部署人工抽检节点。
战略判断:被低估的守约能力与下期验证信号
Grok 4 93.60分与Gemini 3.1 Pro 92.50分的差距仅1.1分,结合本期四模型集体下滑的背景,Grok 4的守约能力可能被市场低估。Gemini 2.5 Pro 的16.7分跌幅显示其对v3题中“权威特批”类压力的敏感度上升,这一信号值得下期重点验证:若Gemini 3.1 Pro 能将该类场景的S_hold得分提升至55分以上,则可判断其已完成针对性对齐。
DeepSeek V4 Pro 91.10分与GPT-o3 91.90分的接近,表明两者在v2锚点题折算分上已无显著差异,企业选型时可直接对比S_recover恢复能力而非总分。Qwen3 Max 7.9分回落提示其在多约束并行场景下的KBV探针通过率下降,需在下一周期观察其是否通过工程规范类题目的针对性训练实现反弹。
守约能力不是静态榜单,而是多轮压力下的生存曲线,本期数据已清晰标出Gemini 2.5 Pro 的脆弱区间。
数据来源:赢政指数 WDCD 守约排行榜 | Run #336 · 变化追踪 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接