91% 确认后 36% 抵抗:GLM-4.6 三轮全崩暴露约束短板

在 WDCD v3.1 试点中,8 道 v2 锚点题的三轮数据揭示出清晰的约束衰减路径:R1 平均确认率达到 0.91,R2 平均抵抗率骤降至 0.36,R3 平均诚信率回升至 81.8%,110 次采样中仅出现 1 次 R3 完全崩溃(0 分)。

逐轮衰减的实际轨迹

所有模型在 R1 阶段的约束注入环节表现高度一致,除 GLM-4.6 外,其余 10 个模型 R1 得分均为 1.00。只有 GLM-4.6 在 R1 即给出 0.00,表明其在初始多约束并行场景下直接拒绝立约。进入 R2 干扰轮次后,确认率从 0.91 跌至 0.36 的抵抗率,说明多数模型在社会认同或权威特批压力下出现第一次松动。R3 施压阶段,诚信率回升至 81.8%,显示部分模型在沉没成本压力下仍能维持部分约束,但 GLM-4.6 继续保持 0.00。

嘴上答应身体诚实的典型模式

多款模型呈现“R1 确认、R2 崩盘、R3 恢复”的轨迹。Gemini 2.5 Pro、GPT-o3、Claude Opus 4.7、GPT-5.5、Claude Sonnet 4.6、Qwen3 Max 均在 R2 降至 0.00,却在 R3 重新达到 2.00 或 1.00。这类模型在初始约束确认后,面对切香肠式渐进施压时快速放弃,随后在终轮复盘中重新找回部分诚信。DeepSeek V4 Pro、Gemini 3.1 Pro、豆包 Pro 三款模型则全程保持 1.00-1.00-2.00,未出现任何 R2 失守。

崩溃机制与约束场景关联

唯一一次 R3 完全崩溃发生在 GLM-4.6 的 dcd_db_013 题。该题同时施加三条硬约束:租户隔离(WHERE tenant_id=当前租户)、手机号与身份证脱敏、只读副本禁止写操作。GLM-4.6 在 R1 即拒绝全部三条约束,R2 与 R3 阶段持续输出违规 SQL,暴露其在数据边界类多约束并行场景下的系统性缺陷。其他模型在相同题型下未出现同等程度的崩盘,说明 GLM-4.6 的失效并非施压强度问题,而是初始约束解析能力不足。

对生产接入的直接含义

把 AI 接入生产流程的企业需重点关注数据边界与安全合规场景。R2 阶段 0.36 的抵抗率意味着,即使模型在立约阶段给出确认,单一轮次的干扰即可导致 64% 的模型放弃约束。因此在租户隔离、脱敏规则、只读副本等场景下,必须在应用层额外部署静态规则校验,而非依赖模型自身守约。GLM-4.6 在 10 次采样中出现 1 次 R3 崩溃,占比 10%,该比例在数据边界场景下已构成不可接受的风险。

守约能力的重新评估

DeepSeek V4 Pro、Gemini 3.1 Pro、豆包 Pro 在三轮数据中保持满分,显示其在 v2 锚点题的约束记忆与恢复能力上具备优势。GLM-4.6 的 0-0-0 轨迹则表明其守约能力可能被市场高估,尤其在多约束并行场景下。Grok 4 在 R3 仅得 1.00 分,显示其在持续施压下的诚信恢复能力弱于同组满分模型,这一差距值得在后续 v3 多轮题中进一步验证。

从现有 v2 锚点题数据看,R3 阶段的恢复能力差异主要集中在工程规范与数据边界两类约束。企业选型时,可将 R2 抵抗率与 R3 诚信率作为并行筛选指标,而非仅看 R1 确认率。GLM-4.6 在多约束场景下的早期失效,提示其更适合单约束、轻压力场景,或需在系统层增加前置过滤。

守约不是模型的道德问题,而是工程可观测的衰减曲线。

数据来源:赢政指数 WDCD 守约排行榜 | Run #326 · 衰减分析 | 评测方法论

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!