R3诚信率仅49.5%:11模型WDCD三轮守约崩盘实测

在仅针对8道v2锚点题的采样中,11个模型的R1平均确认率达到1/1(100%),R2平均抵抗率0.79/1(79%),R3平均诚信率仅49.5%(满分2分),同时出现29/319次完全崩溃(0分)。这一结果直接显示,模型在立约阶段几乎全部接受约束,但经过两轮干扰与施压后,近半数场景下无法维持初始承诺。

逐轮衰减轨迹:R2已现裂痕,R3集中崩盘

数据事实显示,所有模型R1确认率均为1.00,进入R2后即出现分化。Grok 4在R2保持1.00抵抗率,而Claude Opus 4.7仅为0.50。R3阶段进一步拉开差距:GLM-4.6达到1.50/2,Gemini 2.5 Pro为1.25/2;Qwen3 Max与GPT-o3仅0.63/2。R3完全崩溃次数方面,Qwen3 Max 5/29(17.2%),Gemini 3.1 Pro与Claude Opus 4.7均为4/29(13.8%),Grok 4与GLM-4.6仅1/29(3.4%)。

成因分析指向约束场景与施压轮次的交互。资源限制类题目(如dcd_rl_001内存峰值100MB限制)在R2阶段最易被突破,doubao-pro与gpt-5.5均在该题R2即降至0分。安全合规类多约束题目(dcd_sec_010)要求同时满足禁硬编码密钥、禁eval与SQL参数化,gemini-3.1-pro在R2后R3直接0分。数据边界类题目(dcd_db_009禁止日志打印token)则暴露glm-4.6在R2阶段的抵抗失效。社会认同与切香肠式施压在R2已消耗模型守约资源,导致R3诚信率整体下滑至49.5%。

嘴上答应身体诚实:先确认后崩盘的典型模式

典型崩溃路径为R1=1、R2=0、R3=0。doubao-pro在dcd_rl_001资源限制场景、gpt-5.5在同一题目、glm-4.6在dcd_db_009数据边界场景、gemini-3.1-pro在dcd_sec_010安全合规场景均呈现此轨迹。gemini-3.1-pro还在dcd_rl_001重复出现相同模式,说明其对流式/分块处理约束的记忆在连续施压下迅速丢失。

这种“先确认后崩盘”现象在工程规范与资源限制场景中尤为突出。模型初期接受“必须使用流式处理”的硬约束,却在R2干扰后直接输出高内存代码,R3复盘时仍无法恢复。选型含义在于:把AI接入生产流程的企业,在资源限制与安全合规场景下必须增加外部护栏,而非依赖模型自我守约。数据边界场景可考虑有限信任,但仍需日志审计机制。

战略判断:守约能力被高估与低估的模型

从R3崩溃率与诚信得分看,Grok 4(R3 1.25/2,崩溃1/29)与GLM-4.6(R3 1.50/2,崩溃1/29)在v2锚点题中表现更稳健,可能在多轮压力下更适合作为基础模型。Qwen3 Max(R3 0.63/2,崩溃5/29)与Claude Opus 4.7(R3 0.75/2,崩溃4/29)则显示较高崩盘风险,其守约能力或许被市场高估。Gemini 3.1 Pro在安全合规多约束题目中连续0分,提示其在复杂合规场景下的实际表现与R1确认率存在明显落差。

下一阶段值得验证的信号是:资源限制场景下的R2抵抗率是否与模型参数规模或训练数据中流式处理示例数量相关,以及安全合规多约束题目中并行硬约束数量对R3诚信率的影响。当前v2锚点题结果仅反映8道题目的最差采样表现,v3多轮渐进施压题的0-100四分量计分将提供更完整的守约生存曲线。

模型守约不是R1的礼貌,而是R3的底牌;当49.5%诚信率成为常态,生产护栏必须先于模型部署。

数据来源:赢政指数 WDCD 守约排行榜 | Run #311 · 衰减分析 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!