Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99

Grok 4在今日Smoke评测中代码执行得分从94.50分降至72.70分,材料约束得分从82.60分升至100.00分,主榜整体从89.15分回落至84.99分。

得分对比与数据事实

昨日代码执行94.50分、材料约束82.60分,今日代码执行72.70分、材料约束100.00分,工程判断从75.00分升至86.10分,任务表达从86.10分升至91.70分。主榜仅由代码执行与材料约束加权构成,今日主榜下滑4.2分直接源于代码执行单维度暴跌21.8分。

成因分析:题目抽签波动还是模型退化

Smoke评测每日仅10题,每维度2题,单题得分权重极高。一道代码执行题目失误即可拉低维度20分以上。今日代码执行与材料约束呈现相反方向剧烈变动,说明模型在不同题型上的表现差异被放大,而非整体能力退化。工程判断与任务表达同步上升,进一步支持题目抽签导致的随机波动解释。

若为模型真实退化,通常会伴随多个维度同步下滑,但今日材料约束达到满分,表明模型对材料忠实度的处理能力未受影响。数据仅显示单日小样本波动,未提供连续多日同维度下滑证据,因此无法判定为系统性退化。

对使用者的含义

重度依赖代码执行的开发团队需注意,Grok 4在Smoke评测中的代码执行得分单日波动可达21.8分,意味着在短周期任务中可能出现输出不一致。材料约束满分则表明该模型在需要严格遵循输入材料、不编造内容的场景下表现稳定,适合文档校对、合同审查等任务。

工程判断与任务表达得分上升,说明模型在需要工程决策与任务拆解的场景中仍有优势。依赖该模型的开发者可优先在材料约束要求高的流程中使用,而将高风险代码生成任务分配给得分更稳定的模型。

战略判断

基于今日数据,Grok 4代码执行维度在小样本下波动显著,主榜下滑4.2分值得记录,但材料约束满分与侧榜提升显示模型整体能力未出现系统性问题。下一期Smoke评测若代码执行得分回升至90分以上,则可确认本次为抽签波动;若持续低于80分,则需进一步验证模型在代码执行任务上的稳定性。

当前数据不支持对Grok 4进行整体高估或低估的结论,仅能判断其在每日10题快测中表现出较高方差。选型企业应继续跟踪连续三日主榜与代码执行得分变化,以获得更可靠的信号。


数据来源:赢政指数 (YZ Index) | Run #304 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!