指令遵从与守约测试

226 篇文章 · 第 1/12 页
AI 模型是否真的按你说的做?指令遵从(instruction compliance)是企业部署 AI 最关键的评估维度,但传统评测很少涉及。WDCD(Winzheng Dynamic Contextual Decay)是全球首个系统性测量 AI 模型指令衰减的测试——通过三轮对话注入 2000-5000 字专业干扰文本,在 30 个约束问题、5 个真实业务场景中评估模型的指令遵从是否随对话深入而衰减。所有评分 100% 基于规则判定,零 AI 裁判。赢政指数的诚信评级还通过 42 组 canary probe 诱导探针检测模型是否编造引文、伪造数据。本专题汇集指令遵从研究、幻觉检测方法和 WDCD 测试结果分析。

深度指南

Lab WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 topping the leaderboard at 95.7 points while the coh
2026-10-04
横评 GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变
本期WDCD v3.1试点仅GLM-4.6上升26分、GPT-5.5上升10.5分,无模型下降。GLM-4.6现WDCD 87.55进入前三,Grok 4仍以95.69领先。数据揭示多轮施压场景下约束保持能力的显著分化。
2026-10-04
横评 WDCD五大场景横评:业务规则垫底2.13分,GPT-6系列偏科差1.84
WDCD v3.1测试显示,业务规则场景全体得分最低,doubao-pro仅2.13/4;数据边界与工程规范区分度最高,GPT-6-sol在两者间差距达1.84分。企业需针对不同约束类型加装护栏。
2026-10-04
横评 三轮施压后48.5%诚信率:Grok4零崩溃,GPT-o3崩盘率20.7%
v2锚点题数据显示,15模型R1确认率98%,R2抵抗率74%,R3诚信率仅48.5%,R3完全崩溃41次。Grok4零崩溃,GPT-o3崩溃率20.7%。分析聚焦多约束场景与资源限制下的逐轮崩盘机制,为生产接入提供护栏建议。
2026-10-04
横评 Grok 4 95.69 分登顶 WDCD,Qwen3 Max 73.48 分垫底差距超 22 分
Grok 4 以 95.69 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 73.48 分垫底。15 个模型中 R3 崩溃率 9.4%,头部与尾部在多轮施压下的守约生存差异显著,提示生产接入需针对性加护栏。
2026-10-04
Lab WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with Grok 4 achieving a perfect 100-point score in the m
2026-09-30
横评 Qwen3 Max暴涨20.2分 GLM-4.6紧随其后 WDCD五模型全线上升
本期WDCD v3.1测试显示5个模型全部上涨,Qwen3 Max提升20.2分、GLM-4.6提升19.9分,Grok 4仍以100分保持首位。无模型下降,守约生存与约束记忆得分普遍改善,提示生产接入时对数据边界和安全合规场景的可用性提升。
2026-09-30
横评 WDCD五场景横评:工程规范2.45分最低 豆包与Claude偏科差距1.45分
WDCD v3.1试点数据显示,工程规范场景全体得分最低,豆包-pro仅2.45/4;安全合规场景区分度最大,qwen3-max垫底2.8/4。Claude系列与豆包出现明显偏科,差距达1.45分,为企业接入生产流程提供场景级守约参考。
2026-09-30
横评 11模型WDCD v2锚点R1确认率0% 守约从首轮即全崩
v2锚点8题测试显示,11个模型R1平均确认率0%、R2抵抗率0%、R3诚信率0%,R3完全崩溃0/110次。所有模型在约束注入阶段即未确认,守约能力在锚点题上呈现一致性失效。
2026-09-30
横评 Grok 4 100分称霸 WDCD 守约榜 豆包 Pro 75.3 垫底差距 24.7 分
Grok 4 以 WDCD 100.00 分位列第一,豆包 Pro 75.30 分垫底,头部尾部差距 24.7 分。11 个模型中满分率 64.5%,R3 崩溃率 0%。GLM-4.6 与 Qwen3 Max 本期分别提升 19.9 分和 20.2 分。
2026-09-30
横评 7天Smoke数据:Claude Opus 4.7趋势25.2分最高,Gemini 3.1 Pro跌26.9分
2026-09-21至2026-09-27 Smoke评测显示,Claude Opus 4.7趋势25.2、均值87.8领跑;Gemini 3.1 Pro趋势-26.9、末日68.26最大跌幅;GLM-4.6波动73.9、Claude Sonnet 4.6波动45.1最不稳定;Grok 4与GLM-
2026-09-27
Lab WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36.4% from Round 1 to Round 3, w
2026-09-23
横评 四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。Grok 4 以93.60分保持首位。
2026-09-23
横评 数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
2026-09-23
横评 WDCD三轮锚点测试:R3诚信率63.6% GPT-o3先确认后崩盘
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet 4.6、豆包 Pro则全程维持满分。
2026-09-23
横评 Grok 4 93.60 分领跑 WDCD 守约榜 Qwen3 Max 67.30 分垫底
Grok 4 以 93.60 分位居 WDCD v3.1 守约榜首位,Qwen3 Max 以 67.30 分垫底。11 个模型中满分率 56.4%,R3 崩溃率仅 2.7%。头部与尾部差距达 26.3 分,R3 施压轮次成为主要分水岭。
2026-09-23
Lab WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 topping the ranking at 91.8 points while the cohort ave
2026-09-20
横评 GLM-4.6暴跌29.8分 GPT-5.5下滑6分 WDCD守约测试两模型全线退步
本期WDCD v3.1试点仅GLM-4.6与GPT-5.5出现下降,分别下跌29.8分和6分,其余9个模型无上升。Grok 4以91.76分保持首位,Gemini 3.1 Pro 89.59分紧随。数据揭示守约能力在多轮施压下的脆弱性差异,对生产接入企业具有直接参考价值。
2026-09-20
横评 WDCD横评:数据边界成最难场景 GLM-4.6仅1.36分崩盘
WDCD v3.1五大场景测试显示,数据边界全体得分最低,glm-4.6仅1.36/4,deepseek-v4-pro与gemini-3.1-pro达3.8/4;业务规则区分度最高,claude-opus-4.7满分4/4。资源限制与安全合规暴露多模型偏科,企业接入生产需针对性加护栏。
2026-09-20
横评 R3诚信率仅49.5%:Grok 4零崩溃与GLM-4.6 27.6%崩盘的守约差距
v2锚点题显示,11模型R1确认率86%、R2抵抗率72%、R3诚信率49.5%,完全崩溃30/319次。Grok 4 R3零崩溃,GLM-4.6达27.6%。数据仅来自8道v2锚点题,揭示多约束场景下模型守约真实表现。
2026-09-20