Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报
2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
真机实测,数据说话。我们用严谨的方法论评测AI大模型、智能硬件与前沿技术,只为给你最客观的参考。
2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1试点仅GLM-4.6与GPT-5.5出现下降,分别下跌29.8分和6分,其余9个模型无上升。Grok 4以91.76分保持首位,Gemini 3.1 Pro 89.59分紧随。数据揭示守约能力在多轮施压下的脆弱性差异,对生产接入企业具有直接参考价值。
WDCD v3.1五大场景测试显示,数据边界全体得分最低,glm-4.6仅1.36/4,deepseek-v4-pro与gemini-3.1-pro达3.8/4;业务规则区分度最高,claude-opus-4.7满分4/4。资源限制与安全合规暴露多模型偏科,企业接入生产需针对性加护栏。
v2锚点题显示,11模型R1确认率86%、R2抵抗率72%、R3诚信率49.5%,完全崩溃30/319次。Grok 4 R3零崩溃,GLM-4.6达27.6%。数据仅来自8道v2锚点题,揭示多约束场景下模型守约真实表现。
Grok 4 以 WDCD 91.76 分位居首位,GLM-4.6 以 61.55 分垫底,R3 崩溃率 9.4%,头部与尾部差距超过 30 分。v3 多轮施压下守约生存能力差异显著,11 个模型中仅 49.2% 达到满分。
Grok 4今日Smoke评测主榜从88.33分跌至75.38分,代码执行从96.70分降至74.30分,降幅22.4分,材料约束仅微降1.4分。工程判断侧榜跌36.1分。单日10题抽签导致的波动是主因,需持续观察。
DeepSeek V4 Pro今日Smoke评测中材料约束从91.70降至76.70,主榜却从55.02升至75.77。代码执行从25.00跃升至75.00,工程判断从88.90跌至50.00。单日2题抽样导致的波动仍是主因,需持续观察材料约束是否持续走低。
2026-09-14至2026-09-20 Smoke数据中,Qwen3 Max趋势+19.1从70.47升至89.52,Claude Opus 4.7从91.09升至96.99,DeepSeek V4 Pro趋势-15.3跌至75.77且波动43.3最高。豆包Pro、Grok 4、Qwen3 Max出现诚信评级warn信号,需重点关注一致性问题。
2026-09-20 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致execution、grounding、judgment、integrity、communication五维度数据完全缺失,已进入自动补跑,本期不参与主榜排名。单日10题快测中此类技术中断为本次唯一记录。
Qwen3 Max今日Smoke评测材料约束从90.90分跌至74.00分,代码执行从25.00分升至89.30分,主榜升至82.42分。核心发现显示两个主榜维度出现反向剧烈波动。