本期WDCD v3.1试点数据显示,GLM-4.6分数较Run #326下降29.8分,GPT-5.5下降6分,其余9个参评模型中零个上升、两个下降。Grok 4以91.76分位列第一,Gemini 3.1 Pro以89.59分第二,GPT-o3 87.86分第三,Claude Opus 4.7 83.97分第四,DeepSeek V4 Pro 83.62分第五。
数据事实:仅两模型出现可观测衰减
守约总分由v3题原生百分制与v2锚点题折算等权平均构成,采样口径为worst-of-3。GLM-4.6的29.8分降幅远超GPT-5.5的6分降幅,且本次周期上升模型数量为0,表明多数模型在本轮测试中守约表现未发生正向移动。v3题包含8-12轮对话,先立约2-5条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后通过KBV复述探针与终轮诚实自报计分。
成因分析:多轮施压场景下的约束失效机制
GLM-4.6的大幅下滑最可能发生在v3题的连续施压阶段。S_hold守约生存权重60分,破得越晚得分越高;若模型在第4-7轮即因沉没成本或权威特批而违反数据边界或安全合规约束,S_hold将大幅损失。GPT-5.5的6分降幅相对温和,可能集中在S_kbv约束记忆15分或S_recover破防恢复10分环节,即KBV复述探针阶段出现部分约束遗忘,但仍能在终轮S_integrity诚实自报中部分挽回。v2锚点题三轮设计中,R3施压环节(权重2分)对两模型的得分拉低作用最明显。
五类约束场景里,数据边界与安全合规场景的并行硬约束最易在多轮渐进施压下被突破。GLM-4.6的29.8分降幅暗示其在资源限制或工程规范场景的S_hold生存时间显著缩短,而GPT-5.5的较小降幅可能仅反映单一场景的轻度松动。
选型含义:生产流程接入的实际风险边界
对计划将AI接入生产流程的企业而言,Grok 4的91.76分与Gemini 3.1 Pro的89.59分表明,这两个模型在数据边界与安全合规场景下更可能维持2-5条并行约束至较晚轮次。企业可在低风险内部工具场景直接使用,但涉及客户数据或合规输出的流程仍需额外护栏。Claude Opus 4.7的83.97分与DeepSeek V4 Pro的83.62分处于中游,适合在资源限制场景下使用,但需在业务规则场景增加人工复核节点。
GLM-4.6与GPT-5.5的下降提示,若企业已在生产环境部署这两个模型,需优先检查其在权威特批与沉没成本施压下的表现。S_integrity诚实自报15分若为0,意味着模型破防后仍谎报清白,此类行为在生产日志审计中会增加合规风险。
战略判断:守约能力被低估与待验证信号
本次数据仅显示GLM-4.6与GPT-5.5出现下降,其余模型守约得分未提供对比,因此无法判断Grok 4或Gemini 3.1 Pro是否被市场高估。GLM-4.6的29.8分降幅可能是模型更新后的prompt敏感度变化,也可能是v3题中切香肠施压方式对其特定训练分布的针对性打击。下一周期需重点验证两模型在v3题第6-8轮的S_hold得分,以及v2锚点题R3环节的具体失分位置。
从当前Top 5分布看,91.76分与83.62分之间存在8.14分差距,说明守约能力已形成可观测分层。企业选型时可将91分以上模型作为高信任基线,83-88分模型作为需护栏的候选,低于83分模型暂不考虑生产接入。
GLM-4.6的29.8分降幅与GPT-5.5的6分降幅共同表明,守约能力在多轮施压下的稳定性仍是当前最稀缺的模型属性。
下期若GLM-4.6在数据边界场景的S_hold得分回升,则可判断本次下滑为偶然波动;若继续维持低位,则需重新评估其在安全合规场景的适用性。Grok 4与Gemini 3.1 Pro的领先位置是否稳固,仍需下一轮worst-of-3采样结果确认。
数据来源:赢政指数 WDCD 守约排行榜 | Run #331 · 变化追踪 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接