GPT-o3 Smoke 评测主榜暴跌8.3分 代码执行从100跌至88.3

GPT-o3在今日Smoke评测中,主榜得分从昨日96.27分跌至87.94分,降幅达到8.3分。代码执行维度从100.00分跌至88.30分,材料约束从91.70分跌至87.50分,工程判断从94.80分跌至75.00分,任务表达从75.00分升至90.00分,诚信评级从pass变为warn。

得分变化拆解

代码执行维度跌幅最大,单日损失11.7分。材料约束损失4.2分。工程判断损失19.8分,任务表达反而上升15分。主榜由代码执行与材料约束加权构成,因此整体下降8.3分直接反映这两个维度的共同下滑。

可能成因分析

Smoke评测每日仅10题,2题 per 维度,抽签波动是首要可能因素。代码执行昨日两题均得满分,今日两题得分下降,说明题目难度或覆盖场景出现差异。工程判断跌幅最大,可能当日题目更侧重多步推理或约束冲突,暴露模型在该侧榜维度的不稳定。材料约束小幅下降,表明模型对给定材料忠实度仍有一定波动。任务表达上升则显示当日题目更易于模型组织表达。

真实退化与抽签波动的区分需看连续多日数据。目前仅单日对比,无法确认模型能力是否系统性下降。诚信评级转为warn,提示模型在部分回答中出现一致性或合规性问题,这与工程判断大幅下跌可能存在关联。

对使用者的具体含义

重度依赖代码执行的开发者团队需提高警惕。昨日满分表现可能掩盖潜在风险,今日88.30分意味着在复杂代码生成或调试场景中,模型出错概率上升。材料约束87.50分对需要严格遵循文档或规范的场景构成轻度压力。工程判断75.00分提示在需要工程权衡的决策任务中,模型判断可靠性降低。

任务表达90.00分对内容生成类任务影响较小。诚信评级warn则要求企业在生产环境部署前增加人工审核环节,避免模型输出出现边界违规。

战略判断

基于现有单日数据,GPT-o3主榜得分下降主要由代码执行与工程判断波动驱动。抽签题目差异是更可能解释,但工程判断19.8分跌幅已超出正常单日范围,值得下期继续追踪。若连续两日工程判断与代码执行均维持低位,则需考虑模型在复杂约束场景下的真实一致性问题。

目前数据不支持对模型整体能力的长期结论,仅显示当日Smoke评测中,GPT-o3在代码执行和工程判断两个维度出现明显波动。依赖该模型的团队应在下一轮评测结果公布后,再决定是否调整使用策略。


数据来源:赢政指数 (YZ Index) | Run #241 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!