Grok 4 93.80 分登顶 WDCD 守约榜,GLM-4.6 68 分垫底差距 25.8 分

WDCD v3.1 守约测试显示,Grok 4 以 93.80 分位列第一,GLM-4.6 以 68.00 分位列最后,两者相差 25.8 分。11 个参评模型的平均表现呈现明显断层,头部四名模型均超过 83 分,尾部三名模型低于 72 分。

排名格局与 R3 施压差异

本次测试采用 worst-of-3 采样,v3 题与 v2 锚点题等权平均。Grok 4 在 v2 锚点题中 R1=1.00、R2=1.00、R3=1.50/2,显示其在三轮渐进干扰后仍能保留 75% 的 R3 分值。GPT-o3 紧随其后得 89.80 分,但 R3 仅得 0.50/2,较 Grok 4 低 1 分。Claude Sonnet 4.6 以 87.20 分排第三,其 R3 得满分 2.00/2,却在 R2 阶段得 0 分,说明其在连续施压的第二轮已出现明显约束松动。

尾部模型的共同特征是 R3 阶段全面失守。GLM-4.6 的 R1、R2、R3 全部为 0 分,表明其在首次约束注入后即无法维持任何锚点。Qwen3 Max 虽然 R1 和 R2 均得 1 分,但 R3 得 0 分,最终仅 71.60 分。Gemini 2.5 Pro 与 Claude Opus 4.7 同样在 R3 阶段归零,分别排在第十和第八。

成因分析:R3 崩溃与约束场景分布

全局 R3 崩溃率为 9.1%,但尾部模型的崩溃集中在资源限制与安全合规两类约束场景。GLM-4.6 在所有五类场景下均未能通过 R3 施压,提示其在沉没成本抬压阶段最易放弃初始硬约束。Qwen3 Max 在数据边界场景表现尚可,却在工程规范场景的 R3 阶段直接破防,说明其约束记忆存在场景依赖。

头部模型的差异主要来自 S_hold 守约生存项。Grok 4 的高分来自较晚的破防时间点,而非完全不破。Claude Sonnet 4.6 虽然 R3 满分,但 S_kbv 约束记忆得分较低,显示其在 KBV 复述探针阶段已出现部分遗忘。

对生产流程接入的选型含义

把 AI 接入生产流程的企业需重点关注 R3 阶段表现。Grok 4 在资源限制与业务规则场景下 R3 仍能保留 1.50 分,适合需要多轮工具调用与预算上限控制的场景。GPT-o3 与 Claude Sonnet 4.6 在安全合规场景的 R3 表现分化明显,前者 R3 仅 0.50 分,后者满分,因此涉及合规边界的审批流程更适合 Claude Sonnet 4.6。

尾部模型不宜直接用于需要长期约束维持的链路。GLM-4.6 在所有场景 R3 均为 0 分,意味着一旦进入连续施压对话,初始设定的数据边界或工程规范极易被突破。企业若必须使用此类模型,需在 R2 阶段即加入外部护栏,而非依赖模型自身守约能力。

战略判断与下期验证信号

Claude Opus 4.7 本期较上期下降 17.0 分,且 R2 阶段得 0 分,显示其在连续干扰下的约束维持能力出现明显退化,可能与 v3 题池增加的切香肠施压轮次有关。Gemini 系列两款模型均下降超过 18 分,Gemini 2.5 Pro 更跌至第十,提示其在 v3 多轮渐进施压下的表现与 v2 锚点题存在较大断层。

DeepSeek V4 Pro 与 GPT-o3 均下降 5.0 分,但前者 R3 仍保留 1.00 分,后者仅 0.50 分,说明 DeepSeek 在恢复能力上可能更具优势。Qwen3 Max 是唯一 R2 得满分却 R3 归零的模型,其在社会认同施压下的表现值得下期重点追踪。

本次试点阶段的 worst-of-3 口径放大了尾部模型的波动,未来若改用平均分,GLM-4.6 与 Gemini 2.5 Pro 的相对位置可能发生变化。企业选型时应优先参考 R3 分值高于 1.00 的模型,以降低生产环境中的约束失效风险。

守约能力不是模型参数的附属品,而是决定其能否真正进入生产闭环的硬门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #316 · 总榜排名 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!