Grok 4在今日Smoke评测中,材料约束得分从昨日的100.00直接降至84.20,跌幅达到15.8分,导致主榜整体从95.44下滑至90.86。
核心数据对比
代码执行维度从91.70升至96.30,涨幅4.6分;材料约束从100.00降至84.20,跌幅15.8分;工程判断(侧榜,AI辅助评估)从79.90降至61.10,跌幅18.8分;任务表达(侧榜,AI辅助评估)保持70.00不变;主榜最终结果为90.86;诚信评级从warn转为pass。
分数波动成因分析
Smoke评测每日仅10题,每维度2题,单日抽签波动本身会放大分数变化。材料约束与工程判断同时出现大幅下滑,指向本次抽中的题目可能对材料忠实度要求更高,或模型在引用约束上的表现出现明显不一致。代码执行得分上升,说明模型在该维度上的答题稳定性相对较好,并非整体能力退化。
材料约束维度直接影响主榜计算,15.8分的跌幅足以解释主榜4.6分的下滑。工程判断的18.8分跌幅虽为侧榜,但与材料约束的同步变化,提示模型在处理需要严格遵循给定材料的任务时,可能出现更多偏离或遗漏。
对使用者的具体含义
重度依赖材料约束的场景,例如合同审查、政策解读、长文档摘要,Grok 4今日表现提示需增加人工复核环节。代码执行得分96.30的水平,对编写和调试代码的开发者仍具参考价值,但材料约束84.20的水平会降低其在需要严格引用原文的任务中的可靠性。
诚信评级转为pass,表明模型在本次评测中未出现明显违规或幻觉输出,这对需要合规输出的团队是正面信号,但不能抵消材料约束下滑带来的使用风险。
战略判断
基于单日数据,主榜下滑主要由材料约束决定,代码执行的提升显示模型在不同维度间存在明显差异。工程判断与材料约束的同步下跌,指向本次题目抽签可能放大了模型在约束遵循上的不稳定性,而非持续退化。
该波动幅度已超出Smoke评测常见范围,建议下一期评测重点观察材料约束是否回升至95分以上。若连续两日保持在85分以下,则需将Grok 4从材料敏感型任务的首选名单中暂时移除。
目前数据不支持将此次下滑解读为模型整体能力下降,仅能判断材料约束维度在本次抽签下出现明显波动。对依赖主榜排名的选型团队而言,Grok 4今日90.86的主榜分数已低于昨日水平,使用时需按场景区分代码执行与材料约束两个维度的实际表现。
数据来源:赢政指数 (YZ Index) | Run #334 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接