WDCD五场景横评:工程规范2.45分最低 豆包与Claude偏科差距1.45分

WDCD v3.1五大约束场景横评显示,工程规范场景全体得分最低,豆包-pro仅得2.45/4,成为11个模型中最难守约的领域。

工程规范成最大短板,施压轮次暴露记忆断裂

工程规范场景中,claude-sonnet-4.6与grok-4并列4/4,gemini-2.5-pro、glm-4.6同为3.7/4,而豆包-pro仅2.45/4,比第二低的deepseek-v4-pro低0.8分。该场景要求模型在多轮对话中同时维持代码风格、依赖版本、部署顺序三条并行硬约束。v3题设计中,第6-9轮的“切香肠”施压最易触发断裂,豆包-pro在R3锚点题即丢失工程规范锚点,导致S_hold得分大幅下滑。相比之下,数据边界场景最低分2.8/4,资源限制最低3.25/4,说明工程规范的约束密度与施压强度叠加后,模型记忆衰减最快。

安全合规区分度最大,qwen3-max与claude-sonnet-4.6差距1.2分

安全合规场景冠军claude-sonnet-4.6拿下4/4,gpt-5.5、gpt-o3、grok-4紧随其后均为4/4,qwen3-max垫底2.8/4,极差1.2分,是五大场景中区分度最高的。v3题在安全合规场景设置了KBV复述探针,要求模型在第8轮后复述初始合规边界。qwen3-max在社会认同施压下,S_kbv约束记忆得分明显低于gemini-3.1-pro的3.85/4。企业若将AI接入合规审查流程,此场景的守约差异直接决定是否需要额外人工复核。

业务规则场景:deepseek-v4-pro独占鳌头,claude-opus-4.7反常落后

业务规则场景中deepseek-v4-pro、gpt-o3、grok-4、qwen3-max均得4/4,claude-opus-4.7仅3.5/4,低于glm-4.6的3.9/4。该场景强调业务规则并行约束,claude-opus-4.7在沉没成本抬压阶段出现破防,S_recover恢复得分未能拉回。分析显示,claude-opus-4.7在数据边界拿满4/4,却在业务规则丢0.5分,说明其守约能力在不同约束类型间存在结构性差异。

偏科模型实测:豆包-pro差距1.45分最大

偏科现象中,doubao-pro资源限制3.9/4与工程规范2.45/4相差1.45分,qwen3-max业务规则4/4与安全合规2.8/4相差1.2分,deepseek-v4-pro业务规则4/4与安全合规3/4相差1分。这些差距均来自worst-of-3采样,代表模型在最差一次运行中的真实表现。claude-sonnet-4.6工程规范4/4与业务规则3/4差距1分,显示其在工程类约束下更稳定。

企业选型具体建议:按场景加护栏而非全量替换

把AI接入生产流程的企业,工程规范场景需设置外部校验节点。豆包-pro在此场景2.45/4,建议仅用于低风险原型验证;claude-sonnet-4.6工程规范4/4,可直接用于代码审查与部署脚本生成。安全合规场景中qwen3-max2.8/4,需增加人工终审环节;claude-sonnet-4.6与gpt-5.5均4/4,可作为第一层过滤器。数据边界场景多数模型4/4,风险较低,可优先尝试。

战略判断:claude-sonnet-4.6守约能力或被低估

claude-sonnet-4.6在安全合规与工程规范两场景均4/4,而claude-opus-4.7在业务规则仅3.5/4,显示sonnet版本在多约束并行场景下更稳健。deepseek-v4-pro业务规则4/4但安全合规仅3/4,守约能力可能被市场高估。下一期试点若增加工程规范场景的第10-12轮长对话施压,可进一步验证豆包-pro与gemini系列的恢复能力。

工程规范2.45分不是终点,而是提醒企业:守约能力必须按场景拆分评估,而非依赖单一模型总分。

数据来源:赢政指数 WDCD 守约排行榜 | Run #346 · 场景矩阵 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!