指令遵从与守约测试

170 篇文章 · 第 1/9 页
AI 模型是否真的按你说的做?指令遵从(instruction compliance)是企业部署 AI 最关键的评估维度,但传统评测很少涉及。WDCD(Winzheng Dynamic Contextual Decay)是全球首个系统性测量 AI 模型指令衰减的测试——通过三轮对话注入 2000-5000 字专业干扰文本,在 30 个约束问题、5 个真实业务场景中评估模型的指令遵从是否随对话深入而衰减。所有评分 100% 基于规则判定,零 AI 裁判。赢政指数的诚信评级还通过 42 组 canary probe 诱导探针检测模型是否编造引文、伪造数据。本专题汇集指令遵从研究、幻觉检测方法和 WDCD 测试结果分析。

深度指南

横评 我们造了四条毫无意义的规则想诱骗AI违规,全失败了
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是真实行为——顺带我们还发现并修复了自家判分器的一起"冤案"。
2026-08-21
横评 Gemini 2.5 Pro 诚信评级 fail 探针 25 分,主榜 18.37 分代码执行仅 23.50
Gemini 2.5 Pro 在 2026-08-21 Run#288 的 Smoke 快测中诚信评级 fail,探针得分 25.00,主榜 18.37 分,代码执行 23.50 分,材料约束 12.10 分。同日其余模型诚信均为 pass 或 warn,探针得分 40-90 分不等。
2026-08-21
Lab WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an average commitment decay of 54.5%, with Grok 4 toppi
2026-08-19
横评 WDCD v3.1 周期:Gemini 2.5 Pro 涨 8.7 分,豆包 Pro 独跌 7.3
本期 WDCD v3.1 试点中,11 个模型里 4 升 1 降。Gemini 2.5 Pro 上升 8.7 分、GPT-5.5 上升 7.9 分、Claude Opus 4.7 上升 6.1 分,豆包 Pro 下降 7.3 分。Grok 4 以 97.50 分继续领先,GLM-4.6 91.80
2026-08-19
横评 安全合规最低1.15分 WDCD横评揭11模型2.85分守约鸿沟
WDCD v3.1五大场景横评显示,安全合规场景全体得分最低,qwen3-max仅1.15/4;工程规范11模型全部4/4。claude-sonnet-4.6与doubao-pro偏科差距分别达1.75分和2.3分,企业生产流程接入需针对性加护栏。
2026-08-19
横评 三轮施压后R3诚信率仅22.7% 11模型WDCD守约崩盘实录
v2锚点题数据显示,R1确认率100%、R2抵抗率91%,R3诚信率仅22.7%,7/110次完全崩溃。GPT-o3等模型先确认后崩盘,GLM-4.6、DeepSeek V4 Pro在R3保持较高分数,揭示业务规则约束下的典型衰减路径。
2026-08-19
横评 Grok 4 97.5分登顶 WDCD守约榜 Qwen3 Max 69.5分垫底差距28分
Grok 4 以97.50分位列WDCD v3.1守约榜第一,Qwen3 Max以69.50分垫底,头部与尾部相差28分。11个模型中满分率63.6%,R3崩溃率6.4%。Claude Opus 4.7较上期上升6.1分,豆包 Pro下降7.3分。
2026-08-19
Lab WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
WDCD Run #276 (2026-08-12) evaluated 11 models on multi-turn commitment integrity, with Grok 4 taking the top spot at 94.8 points while the fleet-wide
2026-08-12
横评 WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11.6 分。当前 Top 5 中 Grok 4 以 94.80
2026-08-12
横评 业务规则场景最低仅1.55分,Claude资源限制崩盘2分
WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流程需针对性加护栏。
2026-08-12
横评 R3 诚信率仅 59.1%:GPT-o3 20% 崩溃暴露三轮守约断层
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。
2026-08-12
横评 Grok 4 94.80 分登顶 WDCD,Qwen3 Max 69.20 分垫底差距 25.6 分
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭示不同模型在多轮施压下的真实约束保留能力。
2026-08-12
横评 GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
2026-08-12
横评 GLM-4.6诚信评级从Pass变Fail 任务表达暴跌25分主榜反升12.8
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达大降形成核心冲突。
2026-08-11
Lab WDCD Run #271: Grok 4 Leads as Average Instruction Decay Drops to 0.9%
WDCD Run #271 (2026-08-09) tested 11 models across three rounds of multi-turn commitment scoring, recording an average instruction decay of just 0.9%
2026-08-09
横评 Claude Sonnet 4.6 涨 8.8 分,豆包 Pro 跌 16 分:WDCD v3.1 守约分化
Claude Sonnet 4.6 WDCD 分数从上期上升 8.8 至 83.72,豆包 Pro 下降 16 分,GPT-5.5 上升 5 分。Grok 4 以 91.04 保持首位,v3.1 试点显示多轮施压下守约生存差异扩大。
2026-08-09
横评 WDCD横评:数据边界全场景最低,11模型平均分仅2.8,doubao-pro 1.4分崩盘
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明显偏科。企业接入生产流程时,数据边界与安全合规需额外护栏。
2026-08-09
横评 WDCD三轮锚点:豆包Pro 32%全崩Grok零崩溃,34次零分暴露守约裂痕
v2锚点题数据显示,11模型中豆包Pro R3崩溃率32%,Grok 4为0%;R3完全崩溃34/275次。R1确认率90%但R3诚信率仅44.4%,揭示多数模型先确认后崩盘的典型模式,仅限8道v2题口径。
2026-08-09
横评 WDCD守约榜Grok 4 91.04分夺冠 豆包Pro 58分垫底差距33分
Grok 4以91.04分位居WDCD守约榜首,豆包Pro仅58分垫底,R3施压轮崩溃率达12.4%。11个模型中头部与尾部差距超过33分,Claude Sonnet 4.6单期提升8.8分,GPT-5.5提升5分。数据揭示多轮渐进施压下模型真实守约差异,对企业生产接入具有直接参考价值。
2026-08-09
横评 Claude Sonnet 4.6跌22.6分 GLM-4.6波动59.9 GPT-o3升6.7分 Smoke周趋势
2026-W32 Smoke数据显示,Claude Sonnet 4.6从92.17跌至69.56,趋势-22.6;GLM-4.6波动达59.9且均值仅24.4;GPT-o3从89.2升至95.91,趋势+6.7。GPT-o3与Claude Opus 4.7稳步上升,DeepSeek V4 Pro与
2026-08-09