GPT-o3代码执行暴跌32.5分 主榜从96.01跌至80.48

GPT-o3在今日Smoke评测中主榜得分从昨日96.01分降至80.48分,降幅15.5分,其中代码执行维度从97.00分跌至64.50分,降幅32.5分。

数据拆解:核心维度变化

主榜仅由代码执行与材料约束两个可审计维度构成。今日代码执行64.50分、材料约束100.00分,简单平均后得出80.48分。昨日对应数值为代码执行97.00分、材料约束94.80分,平均96.01分。材料约束今日反而提升5.2分,显示模型在材料忠实度上未出现系统性问题。

侧榜(AI辅助评估)数据显示,工程判断从88.90分降至77.30分,任务表达从65.00分升至90.00分。诚信评级维持pass,未触发门槛警告。

成因分析:抽签波动还是真实退化

Smoke评测每日仅2题/维度,共10题,样本量极小。代码执行单日32.5分跌幅,最可能源于题目抽签带来的难度或类型差异,而非模型参数级退化。材料约束同期上升5.2分,进一步支持波动而非整体能力下滑的判断。工程判断下降11.6分可能与代码执行题目关联,但任务表达上升25分显示模型在表达类任务上保持或提升响应质量。

若为真实退化,材料约束不应同步提升;当前双维度反向运动,更符合小样本随机波动特征。

对使用者的含义

重代码执行的团队在部署GPT-o3时需增加冗余验证步骤,尤其在数学计算、算法实现场景。材料约束100.00分表明该模型仍适合需要严格引用原文的文档处理任务。工程判断77.30分(侧榜,AI辅助评估)提示复杂系统设计环节需人工复核。

开发者若依赖单日Smoke结果做选型决策,可能高估或低估真实稳定性。

战略判断

基于今日数据,GPT-o3代码执行一致性值得下期持续追踪。主榜80.48分仍高于多数竞品基线,但单维度32.5分波动已超出正常范围。材料约束满分与代码执行低分并存,说明模型在不同能力轴上表现分化。建议下一轮Smoke重点观察代码执行是否回升至90分以上,以区分偶然波动与系统性变化。

目前无证据支持模型整体退化,使用者可继续观察而非立即更换。


数据来源:赢政指数 (YZ Index) | Run #335 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!