GPT-o3在今日Smoke评测中,主榜得分从昨日的96.93分降至87.93分,下降9分,主要由材料约束维度从95.00分跌至75.00分导致。
得分对比数据
代码执行维度维持98.50分不变。材料约束维度下降20分。工程判断从65.30分升至75.00分,任务表达从65.00分升至91.70分。诚信评级保持pass。
数据事实拆解
Smoke评测每日仅10题,每维度2题。材料约束维度单日损失20分,直接拉低主榜9分。其他两个侧榜维度出现明显回升,任务表达提升26.7分。
可能成因分析
题目抽签波动是首要解释。每日2题的材料约束题目可能包含更严格的引用要求或更长的上下文,模型在单次回答中未能满足约束条件,导致该维度得分从95.00分直接落到75.00分。模型真实退化的可能性较低,因为代码执行维度未出现任何下降,且两个侧榜维度同步上升,显示模型整体输出能力未系统性衰退。
工程判断与任务表达的提升,可能源于今日抽中的题目更匹配模型在结构化表达上的优势,与材料约束题目形成互补。单日数据无法区分随机波动与真实能力变化,但20分的大幅单维度下跌,在仅有2题的测试中属于正常范围内的极端样本。
对使用者的含义
重材料约束的场景下,企业需额外增加人工校验环节。依赖GPT-o3生成带来源引用的报告、合同条款或技术文档的团队,今日数据提示单次输出可能出现约束失效,建议在关键输出后增加二次核对步骤。
对代码执行依赖较高的开发者,98.50分维持不变,短期内可继续使用该模型处理编程任务。需要同时兼顾材料忠实度与工程判断的混合场景,建议将材料约束部分拆分给其他模型或人工处理。
战略判断
本次9分主榜下跌主要源于材料约束单维度极端波动,而非模型整体能力退化。工程判断与任务表达的同步上升,进一步支持波动解释。下一期Smoke评测需观察材料约束维度是否回升至90分以上,若连续两日维持75分左右,则需重新评估该模型在材料约束场景的适用性。
当前数据不支持将GPT-o3在材料约束维度上的表现判定为系统性问题,建议选型团队继续跟踪后续3-5日同一维度的得分标准差,而非依据单日结果调整部署计划。
数据来源:赢政指数 (YZ Index) | Run #284 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接