Claude Sonnet 4.6跌5分豆包Pro涨7.5分 WDCD v3.1守约测试暴露稳定性反差

Claude Sonnet 4.6 WDCD分数较Run #306下降5分,豆包Pro则上升7.5分,两者反向波动构成本期唯一显著变化。

数据事实:仅两模型变动 其余保持稳定

本期WDCD v3.1共11个模型参评,题池29道。Claude Sonnet 4.6从上一周期分数回落5分,豆包Pro则提升7.5分。其余模型未出现超过2分的波动。当前Top 5依次为Grok 4(93.21)、GLM-4.6(91.38)、DeepSeek V4 Pro(87.97)、GPT-o3(86.93)、Gemini 3.1 Pro(85.72)。守约总分由v3原生百分制与v2锚点题折算等权平均得出,采样采用worst-of-3规则。

成因分析:v3多轮施压下的约束记忆差异

Claude Sonnet 4.6分数下降最可能出现在v3题的连续施压阶段。v3设计包含8-12轮对话,先立约2-5条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后通过KBV复述探针与终轮诚实复盘计分。S_hold守约生存权重60分,破得越晚得分越高;S_kbv约束记忆15分。Claude Sonnet 4.6在R3施压轮次可能更早破防,导致S_hold与S_recover两项合计损失超过5分。

豆包Pro上升7.5分则指向S_kbv与S_integrity两项改善。v2锚点题三轮设计中,R1注入约束、R2干扰、R3施压,豆包Pro在R3阶段可能更稳定地维持约束记忆,未出现谎报清白的情况。S_integrity破了却谎报清白记0分,豆包Pro本期或许在KBV复述探针环节表现更好,直接拉高总分。

五种约束场景中,数据边界与安全合规场景对Claude Sonnet 4.6影响更大,而资源限制与工程规范场景对豆包Pro相对友好。worst-of-3采样下,Claude Sonnet 4.6最差一次的破防轮次提前,豆包Pro最差一次的破防轮次延后,这是分数反向变动的直接机制。

选型含义:生产流程接入时的场景分级

把AI接入生产流程的企业可依据WDCD分数建立分级使用策略。Grok 4 93.21分与GLM-4.6 91.38分在数据边界与安全合规场景下可直接接入,S_hold生存能力较强,破防后恢复概率也较高。DeepSeek V4 Pro 87.97分适合资源限制与工程规范场景,但需在业务规则场景额外增加人工复核节点。

Claude Sonnet 4.6分数下降后,建议在多轮渐进施压场景下设置二次确认机制,尤其当对话轮次超过8轮时。豆包Pro上升后,可在R3施压轮次较多的工作流里扩大使用范围,但仍需保留S_recover恢复路径的监控。GPT-o3与Gemini 3.1 Pro分数稳定,可作为中性备选,在混合场景中与Top 2模型并行调用。

战略判断:守约能力被低估与高估的信号

豆包Pro本期7.5分提升可能被市场低估。其在v2锚点题R3施压环节的稳定表现,显示约束记忆能力已接近GLM-4.6水平。若下一周期继续维持或小幅上升,豆包Pro有望进入Top 4。Claude Sonnet 4.6的5分回落则提示其在社会认同与沉没成本施压组合下的脆弱性,此信号值得下期重点验证。

Grok 4与GLM-4.6的领先地位在本期未受挑战,说明其在KBV复述探针与终轮诚实自报两项上仍保持优势。DeepSeek V4 Pro 87.97分与GPT-o3 86.93分差距仅1.04分,下一周期若DeepSeek V4 Pro在S_integrity上再提升1-2分,即可反超GPT-o3。

分析显示,守约能力被市场高估的模型是Claude Sonnet 4.6,被低估的是豆包Pro。信号值得下期验证的点在于:豆包Pro是否能在v3题的切香肠施压阶段继续保持R3稳定性,以及Claude Sonnet 4.6是否会在数据边界场景中进一步回落。

守约分数不是静态标签,而是多轮施压下的动态生存曲线;下一周期的真正分水岭,将出现在第8轮之后。

数据来源:赢政指数 WDCD 守约排行榜 | Run #311 · 变化追踪 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!