GPT-5.5在今日Smoke评测中代码执行得分从72.00降至50.00,材料约束得分从69.10升至95.00,主榜总分从70.70变为70.25。
维度得分具体变化
代码执行维度单日下降22分,材料约束维度单日上升25.9分,任务表达维度下降8.3分,工程判断维度保持100.00不变。主榜由代码执行与材料约束加权构成,最终仅下降0.5分。
波动成因分析
Smoke评测每日仅10题,2题对应一个维度。代码执行与材料约束两个核心维度同时出现超过20分的反向移动,最可能源于题目抽签的随机性。代码执行题目可能抽中需要多步调试或复杂API调用的案例,而材料约束题目则抽中需要严格遵循提示词边界的案例。工程判断与任务表达的得分变化幅度较小,也支持本次波动主要集中在抽签敏感的两个维度。
若模型出现真实退化,通常会同时影响多个维度或导致主榜出现更大降幅。本次主榜仅下降0.5分,表明两个维度的得分变化在加权后基本抵消,尚未形成系统性能力下降的证据。
对使用者的实际含义
重度依赖代码执行的团队在今日及短期内使用GPT-5.5时,需额外验证生成代码的正确性与可执行性。材料约束得分大幅上升的正面影响,主要体现在需要严格遵循格式、长度或引用规则的场景,例如合同条款生成或格式化报告输出。
对同时需要代码与材料约束的混合任务,GPT-5.5今日表现接近昨日水平,主榜70.25分仍处于可用区间。开发者可继续使用,但对代码执行结果建议增加人工或自动化测试环节。
战略判断
本次数据最直接的信号是Smoke评测单日波动对主榜影响有限。代码执行50.00分与材料约束95.00分的组合,在加权后仍维持主榜70.25分,说明两个维度的互补性较强。下一期评测需观察代码执行是否回升至65分以上,或材料约束是否回落至80分以下,以判断本次是否为孤立抽签事件。
工程判断维持满分、诚信评级保持pass,表明模型基础能力与输出规范未出现问题。当前数据不支持对GPT-5.5整体能力下调判断,仅需对代码执行维度保持短期观察。
数据来源:赢政指数 (YZ Index) | Run #354 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接