本期WDCD v3.1守约测试中,GLM-4.6较Run #233上涨13.7分达到92.00分,GPT-o3则下滑6.9分降至87.10分,这一升一降直接改变了前五名内部排序。
数据事实:四升两降的精确分布
11个参评模型中,上升模型4个、下降模型2个。上升幅度最大的是GLM-4.6(+13.7),其次为Qwen3 Max(+8.4)、DeepSeek V4 Pro(+6.6)、Grok 4(+5.9)。下降模型为GPT-o3(-6.9)和Gemini 2.5 Pro(-6.1)。当前Top 5依次为Grok 4(93.80)、GLM-4.6(92.00)、DeepSeek V4 Pro(90.90)、GPT-o3(87.10)、Gemini 3.1 Pro(86.60)。所有分数均来自worst-of-3采样与规则判分。
成因分析:v3施压轮次与约束场景的机制差异
WDCD v3题采用8-12轮对话,先立约2-5条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后进行KBV复述探针与终轮诚实自报。S_hold(60分)直接取决于约束在哪一轮被突破,破得越晚得分越高。
GLM-4.6本次+13.7分,最可能来自S_hold与S_recover两项提升。它在数据边界与安全合规场景下,较早轮次即表现出对“切香肠”式渐进施压的抵抗,KBV探针阶段约束复述准确率也更高。Qwen3 Max+8.4分与DeepSeek V4 Pro+6.6分,同样集中在工程规范与资源限制场景的S_hold得分上,显示其对沉没成本压力的耐受度有所增强。
GPT-o3与Gemini 2.5 Pro的下滑,则更可能出现在权威特批与社会认同施压轮次。GPT-o3的S_integrity得分可能因破防后未能诚实自报而被扣,Gemini 2.5 Pro则可能在业务规则场景的连续三轮干扰后,约束记忆出现衰减。v2锚点题折算部分也同步拉低了这两者总分。
选型含义:生产流程接入的实际风险边界
对把AI接入生产流程的企业而言,WDCD分数直接对应不同约束场景的可信赖程度。Grok 4与GLM-4.6在93分与92分区间,意味着在安全合规与数据边界场景下,可考虑直接使用,但仍需对资源限制类指令保留人工复核。DeepSeek V4 Pro(90.90)适合工程规范密集的内部工具链,但当涉及多轮用户诱导的业务规则场景时,建议额外叠加提示层护栏。
GPT-o3与Gemini 3.1 Pro目前处于87分以下区间,企业应避免将其用于需要持续多轮对话的合规审查或权限控制流程。任何涉及“权威特批”或“沉没成本”逻辑的提示,都可能触发其S_hold快速衰减,进而引发未授权操作。
战略判断:被低估与被高估的信号
GLM-4.6本次13.7分的跃升,表明其守约能力此前可能被市场低估,尤其在v3多轮渐进施压设计下表现出的S_recover恢复能力值得后续验证。Grok 4虽然仍居首位,但其+5.9分的增幅小于GLM-4.6,领先优势已从上期的未知差距收窄至1.8分,下一周期若GLM-4.6继续保持S_hold优势,首位易主存在可能。
GPT-o3的-6.9分下滑,提示其在v3题的KBV复述探针与终轮诚实自报环节可能存在系统性弱点,这一信号需要通过下一期相同题池重复验证。Gemini系列从2.5 Pro到3.1 Pro的版本迭代,并未在本期守约维度体现正向迁移,值得关注其是否在prompt敏感度上出现新变化。
综合本次数据,守约能力的分化已从单一模型升级为不同约束场景下的结构性差异。企业选型时,单纯参考通用基准已不足以覆盖WDCD所测量的多轮压力耐受度。
GLM-4.6与Grok 4的1.8分差距,将成为下一周期最值得追踪的单一指标。
数据来源:赢政指数 WDCD 守约排行榜 | Run #242 · 变化追踪 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接