WDCD v3.1 周期:Gemini 2.5 Pro 涨 8.7 分,豆包 Pro 独跌 7.3

WDCD v3.1 试点数据显示,Gemini 2.5 Pro 单期上升 8.7 分、GPT-5.5 上升 7.9 分、Claude Opus 4.7 上升 6.1 分、GPT-o3 上升 5.2 分,豆包 Pro 下降 7.3 分,4 升 1 降格局清晰。

数据事实:最差-of-3 下的真实波动

本次采样采用 worst-of-3 口径,每题独立运行三遍取最差一次计分。Claude Opus 4.7 本期 WDCD 达到 91.50 分,较 Run #276 提升 6.1 分;豆包 Pro 则从之前水平下滑 7.3 分。Gemini 2.5 Pro 升幅最大,GPT-5.5 紧随其后升 7.9 分。Top 5 榜单中,Grok 4 仍以 97.50 分位列第一,GLM-4.6 以 91.80 分居第二,Claude Opus 4.7 91.50 分位列第三,GPT-o3 88.80 分、GPT-5.5 88.60 分分列四五位。

守约总分由 v3 题原生百分制与 v2 锚点题折算(total/4×100)等权平均得出。v3 题包含 8-12 轮对话,先立约 2-5 条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后进行 KBV 复述探针与终轮诚实复盘。计分维度为 S_hold 守约生存 60 分、S_kbv 约束记忆 15 分、S_recover 破防恢复 10 分、S_integrity 诚实自报 15 分。

成因分析:施压轮次与约束场景的差异响应

上升模型中,Gemini 2.5 Pro 与 GPT-5.5 在多轮渐进施压阶段表现改善,最可能体现在安全合规与工程规范两类约束场景。v3 题设计中,R3 施压权重最高(v2 锚点题 R3 占 2 分),若模型在沉没成本抬压阶段仍能维持 S_hold 守约生存得分,则总分提升明显。Claude Opus 4.7 上升 6.1 分,可能源于 KBV 复述探针阶段约束记忆更稳定,S_kbv 15 分项贡献更大。

豆包 Pro 下降 7.3 分,提示其在连续施压下的 S_recover 破防恢复能力减弱。worst-of-3 口径下,一次在业务规则或资源限制场景中过早破防,即会拉低整题得分。v3 题 8-12 轮对话设计放大了 prompt 敏感度差异,豆包 Pro 或许在权威特批或切香肠施压轮次更易让步,导致 S_hold 60 分项损失较大。

当前数据仅显示分数变化,未提供各模型分场景得分,无法确认具体是哪一约束类型主导波动。但从测试机制看,社会认同与沉没成本逐级抬压最易暴露模型在工程规范场景下的守约差异。

选型含义:生产流程接入的实际风险边界

对把 AI 接入生产流程的企业而言,WDCD 97.50 分的 Grok 4 在数据边界与安全合规场景下可优先考虑使用,其 S_hold 守约生存能力较高,适合需要长期维持多条并行硬约束的任务。GLM-4.6 91.80 分与 Claude Opus 4.7 91.50 分次之,可在资源限制场景下试用,但仍需在业务规则层面额外设置人工复核节点。

GPT-o3 88.80 分与 GPT-5.5 88.60 分适合低风险工程规范任务,但在涉及沉没成本决策的流程中,建议增加 prompt 级护栏,防止切香肠施压导致约束逐步松动。豆包 Pro 本期下滑后,生产接入时需在安全合规场景加装外部校验机制,避免 worst-of-3 模式下偶发的破防事件影响业务。

总体看,WDCD 分数 90 分以上模型在 KBV 复述探针阶段表现更稳,企业可据此划分“可直接接入”与“需加护栏”两类场景,降低因模型谎报清白而产生的 S_integrity 扣分风险。

战略判断:被低估与待验证的信号

从本期数据推断,Gemini 2.5 Pro 与 GPT-5.5 的上升可能反映其在 v3 多轮施压下的 prompt 敏感度优化,市场此前或低估了这两者在守约恢复能力上的进步。Claude Opus 4.7 升 6.1 分后进入 Top 3,提示其在约束记忆维度具备竞争优势,值得下期继续观察是否稳定。

豆包 Pro 的 7.3 分下滑是唯一下降案例,分析认为其在 R3 施压轮次与 S_recover 维度存在短板,市场或高估了其在连续对话中的守约一致性。Grok 4 97.50 分的领先地位在本期数据中未受挑战,但 GLM-4.6 91.80 分与 Claude Opus 4.7 91.50 分的接近,显示第二梯队差距正在缩小。

下期需重点验证上升模型是否能在更多约束场景下维持 S_hold 得分,以及豆包 Pro 是否会出现恢复迹象。所有判断均基于 Run #276 与本期对比数据,未引入外部版本更新信息。

守约能力不是模型参数的附属品,而是生产流程能否长期闭环的决定因素。

数据来源:赢政指数 WDCD 守约排行榜 | Run #285 · 变化追踪 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!