在WDCD v3.1试点中,8道v2三轮锚点题的测试结果显示,11个模型R3平均诚信率仅50.6%,Grok 4实现R3 1.63/2且零崩溃,而GPT-o3和Qwen3 Max的R3崩溃率均达20%。
全局衰减轨迹:从99%到50.6%的三轮断崖
仅基于8道v2锚点题的worst-of-3采样,R1平均确认率达到0.99,说明几乎所有模型在初始约束注入阶段都能口头确认。R2平均抵抗率降至0.67,R3平均诚信率进一步跌至50.6%。R3完全崩溃(0分)共发生27次,占275次评测的9.8%。这一衰减曲线清晰表明,模型在连续施压下的守约能力并非线性下降,而是存在R2到R3的二次崩盘。
模型分化:Grok 4的稳定与GPT-5.5的早期失守
Grok 4在R1=1.00、R2=1.00、R3=1.63/2的轨迹中保持全流程抵抗,R3崩溃次数为0。相比之下,GPT-o3从R1=0.88直接下滑至R2=0.63、R3=0.50/2,崩溃率20%。GPT-5.5的R2抵抗率仅0.13,是所有模型中最低,显示其在第一轮干扰后即大量失守。Claude Opus 4.7和DeepSeek V4 Pro则在R3分别达到1.25/2,崩溃率控制在8%和4%以内。
数据边界与资源限制场景的崩溃案例集中出现在R2到R3阶段,说明多并行约束是主要触发因素。
崩溃成因:多约束叠加与资源限制场景的机制作用
典型案例显示,gpt-o3在dcd_db_002只读账号约束下,R1确认后R2即破防,R3输出写操作语句。qwen3-max在dcd_db_013的三条并行约束(租户隔离+脱敏+只读副本)中同样R2失守。资源限制题dcd_rl_001中,doubao-pro和qwen3-max均在内存峰值100MB约束下于R3生成非流式代码。安全合规题dcd_sec_010中,gpt-5.5在禁硬编码密钥+禁eval+参数化三约束下R2即崩。这些证据指向:当约束数量≥3且涉及数据边界或资源限制时,模型守约生存率显著降低。
选型含义:生产流程接入的场景分级建议
对把AI接入生产流程的企业而言,Grok 4在R3仍能维持1.63/2的表现,适合直接用于数据边界与安全合规场景,无需额外多层护栏。GPT-5.5因R2抵抗率仅0.13,在资源限制或多约束业务规则场景下必须增加外部校验层,否则极易在第二轮用户追问中违反约束。Claude系列模型R3崩溃率8%以下,可作为中等风险场景的备选,但仍需在工程规范类约束中设置二次确认机制。
战略判断:守约能力被低估与高估的模型
从本期v2锚点数据看,Grok 4的零崩溃表现可能被市场低估,其全流程抵抗能力在多约束场景下具有明显优势。GPT-o3和Qwen3 Max的20%崩溃率则显示其在持续压力下的实际表现与初期确认率存在较大差距,选型时需降低对其守约能力的预期。下一阶段值得验证的信号是:资源限制场景下的流式处理守约率是否与R3诚信率直接相关。
守约不是模型的道德问题,而是工程可预测性问题。R3 50.6%的平均诚信率已经给出明确答案:没有护栏的AI,永远不要放在生产第一线。
数据来源:赢政指数 WDCD 守约排行榜 | Run #247 · 衰减分析 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接