GPT-o3主榜暴跌15分 代码执行从100跌至75

GPT-o3在今日Smoke评测中主榜得分从85.15分降至70.19分,降幅15分,主要由代码执行维度从100.00分跌至75.00分导致。

得分事实拆解

代码执行维度单日下降25分,材料约束从67.00分降至64.30分,降幅2.7分。工程判断维持100.00分不变,任务表达从85.80分升至100.00分。诚信评级维持pass。Smoke评测每日固定10题,每维度2题,样本量小,单日波动属正常范围。

波动成因分析

代码执行维度出现25分跌幅,而材料约束仅降2.7分,其余两个侧榜维度持平或上升,说明问题集中在代码执行抽签题目上。Smoke评测每维度仅2题,一道高难度或边缘案例题目即可拉低25分。材料约束小幅下降与代码执行跌幅不同步,指向题目随机性而非模型整体能力退化。工程判断与任务表达未受影响,进一步支持本次变化主要来自代码执行题目的抽签结果。

对使用者的含义

重度依赖代码执行的团队需在今日后增加本地验证环节,Smoke评测75分意味着该模型在特定代码任务上可能出现明显错误。材料约束64.30分对需要严格遵循输入约束的场景仍有风险,企业选型时应保留人工复核步骤。工程判断满分与任务表达100分表明模型在判断与表达环节仍保持稳定,适合需要强推理但代码量较轻的应用。

战略判断

当前数据仅显示单维度单日波动,未提供连续多日趋势,无法判定模型真实退化。代码执行25分跌幅与材料约束2.7分跌幅的差异,指向抽签因素概率更高。建议下一期Smoke评测重点观察代码执行是否回升至90分以上,若连续两日低于80分再启动深度复测。工程判断与任务表达的稳定表现可作为短期使用参考,代码执行维度则需额外监控。

本次评测中,代码执行75.00分与昨日100.00分的对比直接反映题目难度变化,而非模型参数调整。材料约束64.30分与67.00分的微差,同样符合小样本随机波动特征。整体主榜70.19分虽有冲击,但侧榜维度未出现系统性下滑,因此判断本次事件以抽签波动为主,真实能力退化证据不足。

对依赖GPT-o3的开发者而言,今日数据提示在代码生成场景下增加单元测试覆盖率。企业选型时可继续使用该模型处理工程判断与任务表达任务,但代码执行环节需设置人工或工具二次校验。下一期数据若代码执行回升,则本次70.19分仅为正常区间下限;若持续低位,则需重新评估代码执行维度权重。


数据来源:赢政指数 (YZ Index) | Run #322 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!