Gemini 2.5 Pro 主榜从18.37跃至83.39,材料约束12.1直达100

Gemini 2.5 Pro在今日Smoke评测中,主榜得分从昨日的18.37分升至83.39分,代码执行维度从23.50分升至69.80分,材料约束维度从12.10分升至100.00分,诚信评级同时从fail转为pass。

数据事实:单日维度得分变化

代码执行维度昨日23.50分、今日69.80分,材料约束维度昨日12.10分、今日100.00分,工程判断(侧榜,AI辅助评估)从24.40分升至88.90分,任务表达(侧榜,AI辅助评估)从50.00分升至65.00分。主榜仅由代码执行与材料约束两个可审计维度加权构成,因此今日83.39分直接反映这两个维度的共同提升。

成因分析:题目抽签波动最可能解释

Smoke评测每日仅10题(每个维度2题),样本量极小。材料约束维度从12.10分跃至满分,意味着今日抽到的2道材料约束题目均被正确处理,而昨日抽到的题目可能包含更严格的约束条件或更易触发违规的边界案例。代码执行维度同样出现46.3分增幅,也符合小样本下题目难度随机分布导致的得分剧烈摆动。现有数据未显示模型参数或训练发生改变,因此将本次提升归因于模型真实能力退化或进步缺乏依据。

今日材料约束维度达到100.00分,昨日仅12.10分,差值87.9分,远超单题得分标准差可能带来的正常范围。

对使用者的含义

重代码执行的团队在选型时,需注意Gemini 2.5 Pro在Smoke评测中的代码执行得分仍停留在69.80分,距离满分仍有明显差距。依赖材料忠实度的场景则可观察到,今日该模型在材料约束维度已达到100.00分,但昨日同维度仅12.10分,说明单次测试结果不足以作为长期选型依据。

诚信评级从fail转为pass,意味着今日回答通过了诚信门槛,但该门槛本身仅为准入条件,不代表模型在所有场景下均保持一致输出质量。开发者若计划将Gemini 2.5 Pro部署到生产环境,应要求至少连续3个以上独立Smoke评测周期的诚信评级均为pass,才能降低单次抽签波动带来的误判风险。

战略判断

基于现有得分对比,Gemini 2.5 Pro本次主榜提升最可能由题目抽签波动驱动,而非模型能力发生系统性变化。工程判断与任务表达两个侧榜维度同步上升,进一步印证了整体测试题目难度分布的随机性。建议下期重点验证:当材料约束与代码执行题目难度保持相近水平时,Gemini 2.5 Pro是否仍能维持主榜80分以上区间。若连续两期出现类似大幅波动,则需将该模型的测量稳定性列入重点观察名单。

当前数据不支持将Gemini 2.5 Pro判定为“已解决材料约束问题”,也不支持判定其代码执行能力出现实质性退化。唯一可确认的结论是:Smoke评测单日样本量过小,导致单一模型得分在不同日期间出现超过60分的主榜波动,这种波动本身值得持续跟踪。


数据来源:赢政指数 (YZ Index) | Run #289 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!