GPT-o3主榜暴跌13.8分 代码执行从70.3直降48.5

GPT-o3在今日Smoke评测中主榜从80.61分跌至66.86分,代码执行维度从70.30分降至48.50分,单日跌幅21.8分。

数据事实

得分对比显示,代码执行从70.30分跌至48.50分,材料约束从93.20分降至89.30分,主榜因此下降13.8分。工程判断从75.00分升至97.00分,任务表达从90.00分降至66.70分。诚信评级维持pass。

成因分析

Smoke评测每日仅10题,每维度2题,题目抽签波动是主要机制。代码执行维度跌幅最大,说明当日抽中的2题可能超出模型当前稳定处理范围。材料约束仅降3.9分,表明模型对材料忠实度的基础能力未出现系统性退化。工程判断大幅上升22分、任务表达下降23.3分,反映不同维度题目难度分布不均,而非模型整体能力改变。

对使用者的含义

重代码执行的团队需注意,单日Smoke评测中代码执行48.50分意味着该模型在处理复杂代码任务时可能出现明显不稳定。材料约束仍保持89.30分,对材料忠实度敏感的场景仍可继续使用。工程判断97.00分显示其在辅助工程决策场景中表现突出,但任务表达66.70分提示生成结构化输出时需额外校验。

战略判断

本次主榜下跌主要由代码执行单日波动驱动,材料约束变化幅度较小,尚未构成真实退化信号。建议下一期继续观察代码执行维度是否回升至70分附近。若连续两日代码执行保持在50分以下,再考虑模型能力是否出现系统性变化。


数据来源:赢政指数 (YZ Index) | Run #237 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!