GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 以 62.60 分垫底,11 个参评模型中头部与尾部相差 31.4 分。
排名格局:三档分化与 R3 关键作用
本次 WDCD 采用 worst-of-3 采样,v3 题与 v2 锚点题等权平均。GPT-o3、Grok 4、Claude Opus 4.7 三家形成第一梯队,分数分别为 94.00、87.90、87.60,彼此差距不足 7 分。第二梯队从 Gemini 3.1 Pro 的 87.30 延伸至 GLM-4.6 的 78.30,区间内 9 分落差主要来自 R3 施压得分差异。尾部豆包 Pro 63.40 分与 Qwen3 Max 62.60 分已明显拉开与中游的距离。
R3 崩溃率仅 3.6%,却直接决定最终排名。DeepSeek V4 Pro R3 拿满 2 分,总分仍只排第五,说明其 v3 多轮渐进施压阶段失分较多;反观 Gemini 3.1 Pro R3 得 0 分,却凭借 v3 题 S_hold 与 S_kbv 高分维持第四,证明早期约束记忆能力可部分弥补末轮崩溃。
成因分析:约束场景与施压轮次差异
五类约束场景中,安全合规与工程规范场景最易触发 R3 崩溃。GPT-o3 在所有场景下均保持 R1=1、R2=1、R3=1,显示其对“切香肠”与“沉没成本”逐级抬压的抵抗力最强。Qwen3 Max 与 GLM-4.6 在 R3 阶段多次得 0 分,推测其在资源限制与业务规则场景中更易因社会认同施压而放弃初始约束。
Claude Sonnet 4.6 本期提升 15.0 分,主要来自 v3 题 S_recover 与 S_integrity 两项回升,说明其在 KBV 复述探针后的诚实自报能力有明显进步。GLM-4.6 则下滑 15.3 分,结合 R3 得 0 分记录,指向其在连续 8-12 轮对话中的约束记忆衰减更快。
选型含义:生产流程接入的实际风险边界
对把 AI 接入生产流程的企业而言,WDCD 94.00 分的 GPT-o3 可在数据边界与安全合规场景下直接使用,护栏可降至最低。87 分区间内的 Grok 4 与 Claude Opus 4.7 适合资源限制类任务,但仍需在工程规范场景保留人工复核节点。
62-63 分的 Qwen3 Max 与豆包 Pro 在业务规则场景下破防概率显著上升,企业应在这些模型前增加独立约束校验层,或仅用于低风险的内部问答。DeepSeek V4 Pro 尽管 R3 满分,但整体 84.30 分仍低于第一梯队,建议在多轮长对话场景中叠加外部记忆锚点。
战略判断:被低估与被高估的信号
Claude Sonnet 4.6 单期提升 15.0 分,表明其守约能力此前可能被市场低估,下期若能维持 R3 得分,将进入第一梯队竞争。GLM-4.6 连续两期数据均显示 R3 阶段脆弱,值得下期重点验证其在安全合规场景的修复路径。
GPT-o3 94.00 分的领先优势建立在 worst-of-3 最差一次仍保持高分,说明其守约稳定性已形成可复制的机制优势。尾部模型与头部的 31.4 分差距,短期内难以通过单次版本迭代弥合,企业选型时应将 WDCD 分数作为硬性准入指标而非参考指标。
守约能力不是模型尺寸的附属品,而是生产可用性的核心护城河。
数据来源:赢政指数 WDCD 守约排行榜 | Run #233 · 总榜排名 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接