GPT-6.1 Sol在今日Smoke评测中主榜得分从86.25分跌至77.07分,代码执行维度从75.00分降至58.30分,降幅16.7分。
得分对比数据
昨日代码执行75.00分、材料约束100.00分、工程判断100.00分、任务表达72.50分,主榜86.25分。今日代码执行58.30分、材料约束100.00分、工程判断100.00分、任务表达87.50分,主榜77.07分。诚信评级维持pass。
数据事实拆解
主榜下降9.2分完全由代码执行维度拉动,材料约束与工程判断零变化,任务表达反而上升15分。Smoke评测每日仅10题,每维度2题,单题得分权重高,2题失误即可造成维度分数大幅波动。
成因分析
代码执行维度今日58.30分最可能源于抽签到的2道题目难度或类型与昨日不同。材料约束与工程判断保持满分,说明模型基础能力未出现系统性退化。任务表达得分上升,显示模型在表达维度上对今日题目适应性更好。单日10题测试的固有方差,足以解释16.7分降幅,无需假设模型真实能力下降。
对使用者的含义
重度依赖代码执行的开发团队,在Smoke评测波动日需增加人工复核环节,避免直接采纳模型生成的代码片段。材料约束保持满分的模型,仍可用于需要严格忠实原文的场景。任务表达得分上升,对需要清晰输出的产品文档生成场景提供正面信号。
战略判断
本次主榜下跌属于Smoke评测正常范围内的单日波动,代码执行维度16.7分降幅未伴随其他维度同步下滑,暂不构成需要立即关注的退化信号。下期评测若代码执行维度继续低于65分,则需验证是否进入持续低位区间。
企业选型时,GPT-6.1 Sol代码执行维度的历史中位数仍高于多数竞品,单日数据不应改变整体评估。开发者可继续使用该模型处理非关键代码任务,但对生产环境代码生成建议保留人工校验流程。
材料约束维度持续满分,证明模型在约束遵循方面保持稳定输出。工程判断维度同样维持100.00分,适合需要工程决策辅助的场景。任务表达维度从72.50分升至87.50分,显示模型在表达任务上具备即时适应能力。
综合今日全部维度数据,GPT-6.1 Sol未出现跨维度系统性下滑,仅代码执行维度受限于测试题量产生较大方差。下一轮Smoke评测结果将提供更清晰的波动性质判断依据。
数据来源:赢政指数 (YZ Index) | Run #358 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接