GPT-5.5代码执行暴跌25分 主榜仅降3分 材料约束反升24分

GPT-5.5在今日Smoke评测中,代码执行得分从94.50降至69.50,材料约束得分从76.00升至100.00,主榜得分从86.18降至83.23。

数据事实:主榜对冲后的小幅回落

主榜仅由代码执行与材料约束两个可审计维度构成。今日代码执行下降25分,材料约束上升24分,两者相抵后主榜净降3分。工程判断维持100.00不变,任务表达从100.00降至81.70。诚信评级保持pass。

Smoke评测每日仅10题,每维度2题。单日样本量极小,任何一题失误都可造成20-30分级波动。代码执行与材料约束同时出现大幅反向移动,符合抽签波动特征,而非单一方向的系统性退化。

成因分析:题目抽签波动最可能解释

代码执行维度今日丢分集中,可能源于2道题目中至少1道涉及复杂多步计算或长链依赖。材料约束维度同时升至满分,说明同一批题目中模型对指令边界的遵守反而更严格。两种能力在同一模型内同时出现极端反向变化,指向题目内容差异,而非模型参数或训练后更新导致的整体能力退化。

任务表达维度下降18.3分属于侧榜(AI辅助评估),不进入主榜计算。该维度波动与代码执行下降方向一致,但幅度小于执行维度,提示可能存在跨维度题目重叠影响。

对使用者的含义

重代码执行的团队在选型时需额外关注单日波动风险。Smoke评测仅2题/维度,69.50分可能仅反映当日抽中题目难度,而非模型真实代码能力下限。依赖材料约束的场景(如长指令遵循、格式严格输出)今日表现反而更好,可作为互补参考。

开发者若同时使用代码执行与材料约束两个维度,今日数据表明两者存在一定互补性。主榜净降仅3分,说明单一维度暴跌对整体可用性的冲击被部分抵消。

战略判断

基于今日得分对比,代码执行暴跌更可能由题目抽签波动造成,而非模型真实退化。主榜小幅回落与两个维度反向运动的模式一致,暂无证据支持持续性能力下降。下一期Smoke评测若代码执行回升至90分以上,则可进一步确认波动属性;若持续低于75分,则需启动更大样本复测。

工程判断维持满分,表明模型在侧榜(AI辅助评估)层面的决策一致性未受影响。诚信评级pass,满足准入门槛。稳定性与可用性为运行信号,本期未提供相关数据,不纳入判断。

综合来看,GPT-5.5今日表现属于Smoke评测正常范围内的极端样本。选型团队可继续观察后续3-5日数据,再决定是否调整代码执行相关工作流。


数据来源:赢政指数 (YZ Index) | Run #304 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!