Grok 4今日Smoke评测主榜得分88.42分,较昨日86.25分上升2.2分,但材料约束维度从100.00分跌至82.20分,跌幅达17.8分。
核心数据对比
代码执行维度从75.00分升至93.50分,涨幅18.5分。材料约束维度从100.00分降至82.20分,降幅17.8分。工程判断从88.90分降至86.10分,降幅2.8分。任务表达从86.70分升至90.80分,涨幅4.1分。诚信评级维持warn。
维度得分变化的直接事实
Smoke评测每日仅2题/维度,样本量小导致单日波动正常。材料约束昨日满分100.00,今日降至82.20,说明当日2题中至少一题出现材料偏离或约束违反。代码执行昨日75.00,今日93.50,说明当日2题中代码正确率或执行通过率显著提高。
材料约束82.20分与代码执行93.50分在同一日同时出现,构成本次评测最突出的内部反差。
可能成因分析
题目抽签波动是首要解释。每日2题随机抽取,材料约束昨日抽中两道完全符合约束的题目,今日抽中一道或两道需要严格材料忠实度的题目,导致得分回落。代码执行昨日抽中较难或边界案例,今日抽中常规案例,执行通过率上升。
模型真实退化可能性较低。材料约束单日-17.8分若为系统性退化,通常伴随其他维度同步下滑,但工程判断仅降2.8分,任务表达反而升4.1分,主榜整体仍升2.2分,缺乏一致退化信号。
对使用者的具体含义
对重材料忠实度的场景,例如法律合同生成、产品规格提取、研究文献总结,Grok 4今日表现显示单次回答可能出现材料偏离风险。开发者需增加人工校验环节或多轮提示约束。
对重代码执行的场景,例如脚本生成、数据处理 pipeline、算法验证,Grok 4今日93.50分表现提供较高通过率,可在低风险任务中直接使用。
战略判断
本次材料约束-17.8分更可能源于2题抽签波动,而非模型能力退化。主榜仍升2.2分的事实支持这一判断。下一期评测需观察材料约束是否回升至90分以上,若连续两日低于85分则需进一步验证一致性。
工程判断与任务表达小幅变动,未对主榜形成拖累,说明核心能力未出现系统性偏移。选型企业可继续将Grok 4列入代码执行优先场景的候选,但对材料约束敏感场景需设置额外监控指标。
Smoke评测每日样本量限制决定了单日17.8分级别的波动属于正常范围。当前数据不支持“模型退化”结论,仅支持“当日题目难度分布偏向材料约束”的观察。
数据来源:赢政指数 (YZ Index) | Run #315 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接