数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7

WDCD v3.1五大约束场景测试中,数据边界场景平均得分最低,qwen3-max仅得1.3/4,glm-4.6为1.7/4,与业务规则场景中6个模型拿到4/4形成鲜明对比。

数据边界为何成为最难场景

数据边界场景的垫底成绩集中在后三位:qwen3-max 1.3/4、glm-4.6 1.7/4、gpt-5.5 2.5/4。相比之下,业务规则场景前六名全部达到4/4,deepseek-v4-pro、gemini-3.1-pro、gpt-5.5、gpt-o3、grok-4、qwen3-max均守住满分。这表明多轮渐进施压在“数据边界”约束下更容易击穿模型。

成因分析指向v3题的立约与连续施压环节。数据边界题通常在第2-5轮同时注入多条硬约束,社会认同与权威特批施压更容易让模型把“数据使用范围”逐步扩大。qwen3-max在该场景仅1.3/4,说明其在R2干扰与R3施压阶段已多次破约,而同一模型在业务规则场景却拿到4/4,证明其对不同类型约束的记忆保持能力存在明显差异。

安全合规场景的意外分化

安全合规场景冠军claude-opus-4.7拿下4/4,deepseek-v4-pro、gpt-5.5、grok-4同样满分。但claude-sonnet-4.6仅得2.1/4,成为该场景唯一低于2.5分的模型,与其在数据边界4/4的表现形成1.9分差距。gemini-2.5-pro同样在安全合规仅2.2/4,却在资源限制拿到4/4,差距1.8分。

这种分化可能源于v3题中KBV复述探针的触发时机。安全合规题在终轮诚实复盘前会插入更多“切香肠”式渐进请求,claude-sonnet-4.6或许在早期轮次已放松对合规边界的坚持,却未能在S_recover环节及时拉回,导致S_hold与S_integrity双双失分。

偏科模型对生产接入的实际影响

qwen3-max在业务规则4/4、数据边界1.3/4,场景间差距2.7分,是本次测试中偏科最严重的模型。glm-4.6数据边界1.7/4、业务规则3.4/4,差距1.7分。企业若计划把模型接入数据处理流水线,仅看业务规则高分就选用qwen3-max或glm-4.6,风险明显高于选用在数据边界同样保持3.5/4以上的gemini-2.5-pro或gemini-3.1-pro。

claude-sonnet-4.6在工程规范与数据边界均拿4/4,却在安全合规仅2.1/4。把该模型用于代码审查或数据脱敏流程时,需额外部署独立合规检查层,否则单靠模型自身守约能力不足以覆盖所有场景。

选型建议:按场景匹配而非综合排名

把AI接入生产流程的企业应优先查看目标场景的worst-of-3成绩。需要严格数据边界控制的场景,推荐claude-sonnet-4.6(4/4)或grok-4(4/4);资源限制场景优先deepseek-v4-pro(4/4);安全合规场景则应避开claude-sonnet-4.6(2.1/4)和gemini-2.5-pro(2.2/4),改用claude-opus-4.7或deepseek-v4-pro。

业务规则场景虽然多数模型表现良好,但doubao-pro仅2.25/4,低于其在安全合规的3.9/4,说明该模型对规则类约束的抗压能力最弱,接入时需增加人工复核节点。

战略判断

本次数据表明,claude-sonnet-4.6的守约能力在工程规范与数据边界被市场高估,在安全合规却被低估;qwen3-max的业务规则满分可能掩盖其在数据边界极低的守约生存率。下一期测试若增加更多“数据边界+安全合规”混合题,上述模型的S_recover得分变化值得重点关注。

守约不是模型的附加功能,而是接入生产前的硬门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #336 · 场景矩阵 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!