GPT-o3代码执行暴跌24.5分 主榜掉15.2,抽签还是真实退化

GPT-o3在今日Smoke评测中主榜得分从96.01降至80.78,代码执行维度从97.00直接跌至72.50,降幅达到24.5分。

数据事实:单维度极端波动

对比昨日与今日得分,代码执行出现-24.5分的单日变化,材料约束从94.80降至90.90,仅-3.9分。工程判断维持100.00不变,任务表达则从75.00升至90.00,上涨15分。主榜整体因此下降15.2分。诚信评级保持pass。

Smoke评测每日仅2题/维度,样本量极小。代码执行单项24.5分的跌幅,意味着至少一道题目得分出现大幅下滑。材料约束的3.9分降幅则在正常波动范围内。

成因分析:抽签波动概率更高

从维度构成看,代码执行对具体题目敏感度最高。2题测试中,若遇到边界条件复杂或需要多步推理的题目,模型一次失误即可拉低平均分24.5分。材料约束降幅较小,说明模型在忠实度方面的基础能力未出现系统性问题。

工程判断连续两日保持满分,任务表达反而提升,表明模型在侧榜能力上未同步下滑。若为真实退化,通常会伴随多个维度同时走弱,而本次仅代码执行一枝独秀,因此抽签波动是更合理的解释。

对使用者的含义

重度依赖代码生成的团队需注意,单日Smoke得分不能直接等同于日常使用表现。72.50分的代码执行得分可能仅反映当日2题的难度分布,而非模型整体编程能力下降。

对材料忠实度要求较高的场景影响有限,材料约束仍维持在90.90分,降幅不足以改变选型决策。工程判断满分则说明模型在判断类任务上依然稳定。

战略判断:暂无需过度关注

基于现有得分对比,GPT-o3本次主榜下跌最可能由题目抽签造成,而非模型真实退化。工程判断与任务表达的稳定或上升,进一步支持这一判断。

建议下一期Smoke评测继续观察代码执行维度,若连续两日出现类似24分以上跌幅,再考虑启动更大数据集验证。当前单日数据不足以得出模型能力退化的结论。

企业选型时仍可将GPT-o3作为代码执行备选,但需搭配多日平均分或更大样本测试,避免被单次抽签结果误导。


数据来源:赢政指数 (YZ Index) | Run #341 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!