Grok 4 代码执行暴跌19.5分 材料约束反升23.2分 主榜仅降0.3

Grok 4在今日Smoke评测中代码执行得分从92.00分跌至72.50分,降幅19.5分,同时材料约束从60.90分升至84.10分,增幅23.2分,主榜得分从78.01分微降至77.72分。

得分变化的直接数据对比

代码执行维度昨日92.00分、今日72.50分,差值-19.5;材料约束昨日60.90分、今日84.10分,差值+23.2;工程判断昨日94.50分、今日75.00分,差值-19.5;任务表达昨日76.70分、今日86.70分,差值+10;主榜昨日78.01分、今日77.72分,差值-0.3。诚信评级维持pass。

波动成因的机制分析

Smoke评测每日仅2题/维度,共10题,单题得分权重高,题目抽签随机性直接放大分数标准差。代码执行与工程判断同降19.5分,提示可能抽中对代码路径或逻辑链要求更高的题目;材料约束反升23.2分,显示另2题可能更侧重引用忠实度或约束遵守,模型在这些样本上表现提升。主榜仅降0.3分,说明两个核心维度此消彼长后整体加权影响有限。

现有数据无法区分题目抽签波动与模型真实退化。若连续多日出现同方向大波动,则更可能指向能力变化;单日数据仅支持“抽签影响为主”的判断。

对使用者的场景含义

重代码执行的团队在今日得分环境下需额外验证Grok 4输出,尤其涉及多步计算或API调用的场景;材料约束升至84.10分,对需要严格引用原文或避免幻觉的文档生成任务反而提供更高可信度。工程判断跌至75.00分,依赖模型做架构决策或权衡分析的开发者应增加人工复核环节。

战略判断与下期验证信号

主榜微降0.3分显示Grok 4整体竞争力未受实质冲击,但代码执行与材料约束的剧烈互补变化值得下期继续追踪。若下期代码执行回升且材料约束回落,则确认本次为抽签波动;若代码执行持续低于80分,则需评估是否进入能力调整窗口。当前数据支持将Grok 4代码执行能力列为重点监控项,而非整体下调优先级。


数据来源:赢政指数 (YZ Index) | Run #255 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!