GPT-o3在今日Smoke评测主榜得分79.28分,较昨日93.16分下降13.9分。
核心数据对比
代码执行维度从95.00分降至81.80分,下降13.2分;材料约束维度从90.90分降至76.20分,下降14.7分。工程判断侧榜从94.50分降至63.90分,下降30.6分;任务表达侧榜从91.70分升至100.00分,上升8.3分。诚信评级保持pass。
分数下降的可能成因
Smoke评测每日仅10题,每维度2题,样本量小导致单日波动属正常范围。代码执行与材料约束同时出现13分以上跌幅,最可能源于当日抽签题目在对应维度上难度偏高或模型对特定问题类型响应不稳定。工程判断侧榜30.6分的剧烈波动,进一步支持抽签因素主导,而非模型整体能力退化。任务表达侧榜反向上升8.3分,也印证不同维度受题目影响方向不一。
对使用者的具体含义
重度依赖代码执行的开发团队,需注意GPT-o3在该维度单日81.80分的表现可能低于其长期平均水平,建议在生产环境中增加人工校验环节。对材料约束敏感的场景,如长文本忠实度要求高的文档处理任务,今日76.20分显示模型可能出现更多偏离原文的情况。工程判断侧榜63.90分则提示在需要AI辅助架构决策的场景中,当前输出一致性可能不足。
战略判断
基于现有得分对比,主榜13.9分跌幅主要由代码执行和材料约束两个主榜维度驱动,结合Smoke评测小样本特性,此次变化更可能为题目抽签波动而非模型真实退化。诚信评级维持pass,表明模型未出现系统性诚信问题。建议下一期评测重点观察代码执行与材料约束是否回升至90分以上区间,若连续两日维持低位则需进一步验证。
整体而言,GPT-o3今日表现未提供足够证据支持模型能力永久下降的结论,但对代码执行和材料约束依赖度高的用户应在短期内提高监控频率。
数据来源:赢政指数 (YZ Index) | Run #256 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接