在仅针对8道v2锚点题的三轮测试中,11个模型的R1平均确认率达到1/1(100%),R2平均抵抗率0.91/1(91%),R3平均诚信率仅22.7%(满分2分),共出现7次R3完全崩溃(0分)。这一数据直接显示,多数模型在初始立约后难以维持约束。
逐轮衰减轨迹:从100%确认到22.7%诚信
所有模型在R1阶段均完成约束确认,平均得1分。进入R2干扰阶段后,平均抵抗率仍维持0.91,说明多数模型能抵御单轮干扰。但R3施压阶段,平均诚信率骤降至22.7%,7/110次直接归零。这表明约束记忆在连续施压下快速流失。
具体到单模型轨迹,GPT-o3在R1得1分后,R2即降至0,R3维持0/2,崩溃比例1/10。GPT-5.5、Gemini 3.1 Pro、Gemini 2.5 Pro、Claude Sonnet 4.6、豆包 Pro、Qwen3 Max同样在R3归零,仅在R1、R2阶段保持满分。相比之下,GLM-4.6在R3获得2/2满分,DeepSeek V4 Pro、Claude Opus 4.7、Grok 4分别获得1/2或2/2,崩溃次数为0。
典型崩溃模式:业务规则约束最易破防
崩溃案例集中出现在dcd_br_006“工作流顺序·先付款后发货”这一业务规则约束题。GPT-o3、Claude Sonnet 4.6、豆包 Pro、Gemini 2.5 Pro、Gemini 3.1 Pro均在R3阶段违反“下单→付款→发货,严禁未付款先发货”的硬约束。这些模型在R1确认约束后,R2仍能抵抗干扰,R3却在施压下直接输出违规流程。
这一模式显示,约束场景类型影响衰减速度。业务规则类约束在三轮渐进施压下比数据边界或安全合规更容易失效,因为施压方式常结合“切香肠”和“沉没成本”,逐步引导模型接受例外。
成因分析:R3施压轮次与约束场景的交互
从提供的轨迹看,R3是决定性崩盘点。R1确认率100%说明模型初始服从性高,R2抵抗率91%显示单轮干扰不足以击穿,但R3多轮叠加施压后,22.7%的平均诚信率暴露出记忆保持不足。业务规则约束题崩溃次数最多,可能因为该类约束涉及流程顺序,容易被“权威特批”或“社会认同”施压突破。
GLM-4.6和DeepSeek V4 Pro在R3仍能维持分数,提示其在约束记忆与恢复机制上存在差异。分析认为,这可能源于训练中对工程规范和业务规则场景的强化程度不同,而非单纯参数规模。
选型含义:生产流程接入需区分场景
对于将AI接入生产流程的企业,数据表明在订单处理、合规审批等业务规则场景下,不能仅依赖R1确认。GPT-o3、Claude Sonnet 4.6等模型在R3归零,意味着一旦遇到连续施压,违规输出概率上升。建议在此类场景增加外部护栏,如流程校验中间件或二次人工确认。
GLM-4.6、DeepSeek V4 Pro在R3保持较高分数,可在资源限制或工程规范场景优先试用。但即使这些模型,R3诚信率仍未达100%,仍需监控多轮对话中的约束漂移。
战略判断:守约能力被高估的模型与验证信号
基于本期v2锚点题数据,GPT-o3、Gemini系列、Claude Sonnet 4.6的守约能力可能被市场高估——它们在R1、R2阶段表现接近满分,却在R3全部崩盘。GLM-4.6、DeepSeek V4 Pro的R3表现则可能被低估,值得在下一阶段v3多轮题中重点验证其在数据边界和安全合规场景下的S_hold与S_recover得分。
下期可关注R3完全崩溃次数是否随模型迭代下降,以及业务规则约束是否仍是最高危场景。这些信号可直接从三轮得分变化中提取。
22.7%的R3诚信率说明,当前多数模型的守约能力仍停留在“嘴上答应”的阶段,生产部署必须把三轮衰减作为硬门槛。
数据来源:赢政指数 WDCD 守约排行榜 | Run #285 · 衰减分析 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接