GPT-5.5代码执行从100跌至75 主榜单日下滑10.1分

GPT-5.5在今日Smoke评测中主榜得分从86.50分降至76.44分,降幅10.1分。

得分对比数据

代码执行维度昨日100.00分、今日75.00分,降幅25分。材料约束维度昨日70.00分、今日78.20分,升幅8.2分。工程判断(侧榜,AI辅助评估)从50.00分升至100.00分。任务表达(侧榜,AI辅助评估)从91.70分微降至90.00分。诚信评级维持pass。

数据事实拆解

主榜由代码执行与材料约束两个可审计维度构成。今日主榜76.44分直接来自代码执行75.00分与材料约束78.20分的加权平均。代码执行单维度25分跌幅是主榜下滑的唯一来源,材料约束的8.2分回升仅部分抵消了这一损失。

成因分析

Smoke评测每日仅2题/维度,样本量极小。代码执行从100.00分跌至75.00分,最可能的原因是今日抽到的两道题目难度高于昨日,导致模型在该维度得分出现大幅波动。材料约束得分上升8.2分同样指向题目抽签差异,而非模型能力系统性变化。工程判断从50.00分升至100.00分,进一步印证单日题目随机性对侧榜的影响。

真实退化与题目波动需通过连续多日数据区分。目前仅单日对比,无法确认模型在代码执行上的能力是否已发生结构性下降。诚信评级维持pass,说明模型回答未出现诚信层面问题。

对使用者的含义

重代码执行的团队需注意,GPT-5.5在该维度单日得分可出现25分级波动。依赖模型生成可靠代码的开发者,应增加人工复核环节,避免将今日75.00分表现视为常态。材料约束升至78.20分的表现,对需要模型严格遵循输入约束的场景提供一定缓冲。

工程判断升至100.00分,对需要模型进行工程决策辅助的场景形成正面信号,但该维度为侧榜,AI辅助评估结果仅供参考。

战略判断

本次主榜10.1分下滑主要由代码执行维度25分跌幅驱动,结合Smoke评测每日仅10题的特性,判断本次变化更可能是题目抽签波动导致,而非模型真实退化。下一期评测需重点观察代码执行维度是否回升至90分以上。若连续两日代码执行得分均低于80分,则需将该信号标记为潜在能力变化。

材料约束维度78.20分与工程判断100.00分的组合,显示GPT-5.5在约束遵循与工程判断上仍有可用性。选型企业可继续保留GPT-5.5作为多模型组合中的一环,但应降低其在纯代码生成任务中的权重。


数据来源:赢政指数 (YZ Index) | Run #332 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!