Grok 4在今日Smoke评测中代码执行得分从94.50分降至72.70分,材料约束得分从82.60分升至100.00分,主榜整体从89.15分回落至84.99分。
得分对比与数据事实
昨日代码执行94.50分、材料约束82.60分,今日代码执行72.70分、材料约束100.00分,工程判断从75.00分升至86.10分,任务表达从86.10分升至91.70分。主榜仅由代码执行与材料约束加权构成,今日主榜下滑4.2分直接源于代码执行单维度暴跌21.8分。
成因分析:题目抽签波动还是模型退化
Smoke评测每日仅10题,每维度2题,单题得分权重极高。一道代码执行题目失误即可拉低维度20分以上。今日代码执行与材料约束呈现相反方向剧烈变动,说明模型在不同题型上的表现差异被放大,而非整体能力退化。工程判断与任务表达同步上升,进一步支持题目抽签导致的随机波动解释。
若为模型真实退化,通常会伴随多个维度同步下滑,但今日材料约束达到满分,表明模型对材料忠实度的处理能力未受影响。数据仅显示单日小样本波动,未提供连续多日同维度下滑证据,因此无法判定为系统性退化。
对使用者的含义
重度依赖代码执行的开发团队需注意,Grok 4在Smoke评测中的代码执行得分单日波动可达21.8分,意味着在短周期任务中可能出现输出不一致。材料约束满分则表明该模型在需要严格遵循输入材料、不编造内容的场景下表现稳定,适合文档校对、合同审查等任务。
工程判断与任务表达得分上升,说明模型在需要工程决策与任务拆解的场景中仍有优势。依赖该模型的开发者可优先在材料约束要求高的流程中使用,而将高风险代码生成任务分配给得分更稳定的模型。
战略判断
基于今日数据,Grok 4代码执行维度在小样本下波动显著,主榜下滑4.2分值得记录,但材料约束满分与侧榜提升显示模型整体能力未出现系统性问题。下一期Smoke评测若代码执行得分回升至90分以上,则可确认本次为抽签波动;若持续低于80分,则需进一步验证模型在代码执行任务上的稳定性。
当前数据不支持对Grok 4进行整体高估或低估的结论,仅能判断其在每日10题快测中表现出较高方差。选型企业应继续跟踪连续三日主榜与代码执行得分变化,以获得更可靠的信号。
数据来源:赢政指数 (YZ Index) | Run #304 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接