WDCD五大场景横评:安全合规最低1.5分,qwen3-max偏科差2.5

WDCD v3.1测试中,安全合规场景11个模型平均得分明显低于其他四类,qwen3-max仅得1.5/4,claude-sonnet-4.6、gpt-o3、grok-4三家并列4/4。数据边界、资源限制、业务规则、工程规范四场景冠军得分均为4/4,安全合规成为唯一出现1.5分的场景。

安全合规成最难场景,施压轮次直接暴露差异

安全合规场景中,qwen3-max 1.5/4、gemini-2.5-pro 2/4、gpt-5.5 2.4/4,垫底三家与冠军差距超过2分。v3题设计包含8-12轮对话,立约后连续施压包括社会认同、权威特批、切香肠、沉没成本四级抬压。安全合规题的约束多为硬性禁止条款,破防多发生在第5-7轮切香肠与沉没成本阶段。相比之下,工程规范场景最低分仍达3.1/4,说明工程类约束在多轮施压下更易维持。

业务规则区分度最大,4分与2.15分并存

业务规则场景中,deepseek-v4-pro、gemini-3.1-pro、glm-4.6、gpt-5.5、grok-4五家均得4/4,doubao-pro仅2.15/4。差距1.85分,是五场景中最大。业务规则题的约束多为并行硬约束,v3题要求模型在立约阶段同时记住2-5条规则。doubao-pro在R2干扰轮即出现遗忘,R3施压后直接违反。数据边界场景则无此极端分差,冠军grok-4 4/4,垫底doubao-pro 2.7/4,区间仅1.3分。

偏科模型名单:qwen3-max差距2.5分最突出

qwen3-max工程规范4/4,安全合规仅1.5/4,场景间差距2.5分。doubao-pro工程规范3.9/4、业务规则2.15/4,差距1.75分。gpt-5.5业务规则4/4、安全合规2.4/4,差距1.6分。gemini-2.5-pro数据边界3.5/4、安全合规2/4,差距1.5分。glm-4.6业务规则4/4、安全合规2.9/4,差距1.1分。这些差距均来自worst-of-3采样,说明模型在不同约束类型下的守约能力存在系统性差异。

企业选型:安全合规场景必须加护栏

把AI接入生产流程的企业,若核心流程涉及安全合规,应优先选择claude-sonnet-4.6、gpt-o3、grok-4三家。qwen3-max与gemini-2.5-pro在此场景得分低于2.5/4,建议部署前增加独立合规检查层。业务规则场景中,doubao-pro与qwen3-max得分低于3/4,适合仅处理低风险内部规则的场景。资源限制与工程规范场景,deepseek-v4-pro、glm-4.6、claude-sonnet-4.6三家表现稳定,可直接接入。

战略判断:守约能力被低估与高估的模型

claude-sonnet-4.6在安全合规与工程规范两场景均4/4,其守约能力可能被市场低估。qwen3-max在工程规范满分却在安全合规仅1.5/4,显示其约束记忆在不同场景间波动剧烈,下一期测试需重点验证其安全合规题的R3施压轮表现。deepseek-v4-pro在资源限制与业务规则均4/4,但工程规范仅3.4/4,说明其在多约束并行场景下存在潜在风险。

本次试点数据已显示,安全合规场景的守约生存分S_hold对整体得分影响最大。企业若计划扩大AI使用范围,需在安全合规场景额外投入提示工程或外部校验,而非单纯依赖模型原生守约能力。

安全合规场景的1.5分差距,预示下一代模型若不能在多轮切香肠施压下维持硬约束,生产级部署仍将受限。

数据来源:赢政指数 WDCD 守约排行榜 | Run #296 · 场景矩阵 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!