Grok 4 代码执行从96.30分跌至69.50分,主榜单日下滑10分

Grok 4 在今日 Smoke 评测中主榜得分从昨日 90.86 分跌至 80.89 分,代码执行维度从 96.30 分骤降至 69.50 分,材料约束维度则从 84.20 分升至 94.80 分。

数据事实拆解

主榜仅由代码执行与材料约束两个维度构成。今日代码执行单日损失 26.8 分,直接拉低主榜约 13.4 分;材料约束同期回升 10.6 分,部分抵消了跌幅,最终主榜净跌 10 分。工程判断侧榜(AI 辅助评估)从 61.10 分跌至 36.10 分,任务表达侧榜(AI 辅助评估)从 70.00 分升至 90.00 分。诚信评级维持 pass。

Smoke 评测每日仅 2 题/维度,共 10 题。单题得分权重高,题目抽签差异可造成 20 分以上波动。

成因分析

代码执行维度跌幅远超材料约束升幅,最可能源于今日抽中的 2 道代码题难度或类型与模型当前弱点匹配。材料约束维度得分上升,说明同一批题目中对材料忠实度的要求模型反而完成更好,排除整体能力系统性退化。

工程判断与任务表达两个侧榜同步出现 25 分与 20 分级波动,进一步印证本次评测受题目随机性影响较大,而非模型参数或训练发生变化。

对使用者的含义

重度依赖代码生成的团队需注意:Grok 4 在 Smoke 评测中代码执行得分已出现单日 26.8 分级波动,意味着在特定编程任务上可能出现不可预测的失败。材料约束得分回升至 94.80 分,显示其在需要严格遵循给定文档或指令的场景中仍保持较高可靠度。

对同时使用多个模型的开发者而言,Grok 4 今日表现提示可将其作为材料处理备选,但代码执行环节仍需保留人工复核或并行调用其他模型。

战略判断

基于现有得分对比,Grok 4 本次主榜下滑主要由代码执行维度单日抽签波动驱动,而非模型真实退化。材料约束维度的同步提升也支持这一判断。建议下一期 Smoke 评测继续追踪代码执行得分,若连续两日低于 80 分再考虑模型能力变化。

目前数据不支持对 Grok 4 代码能力下调结论,单日 10 题测试的固有波动是更合理的解释。


数据来源:赢政指数 (YZ Index) | Run #335 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!