Gemini 2.5 Pro代码执行暴跌25分 主榜下滑7.2分

Gemini 2.5 Pro在今日Smoke评测中代码执行得分从100.00分跌至75.00分,主榜从88.75分降至81.53分。

数据事实拆解

得分对比显示,代码执行下降25分,工程判断同时下降25分至50.00分,任务表达上升8.3分至90.00分,材料约束上升14.5分至89.50分。主榜整体下滑7.2分。诚信评级维持pass。

成因分析

Smoke评测每日仅10题,每维度2题,样本量小,题目抽签波动是首要可能原因。代码执行与工程判断同时出现25分跌幅,提示本次抽中的题目可能集中暴露模型在复杂代码路径或约束条件下的处理不一致。材料约束与任务表达得分上升,表明模型在文本忠实度和表达清晰度上未出现系统性退化。

真实模型退化的可能性较低。单日数据无法支持连续性结论,两个维度同步下跌更符合小样本随机性,而非参数层面发生改变。工程判断作为侧榜维度,与代码执行的关联性较强,两者同幅波动进一步指向题目特性而非模型能力整体下滑。

对使用者的含义

重代码执行的团队在依赖Gemini 2.5 Pro处理多步调试或算法实现时,需增加人工复核环节。本次75.00分水平低于昨日100.00分基准,意味着同类任务出错概率上升。材料约束得分上升至89.50分,对需要严格遵循输入指令的场景反而提供更稳定输出。

开发者在集成Gemini 2.5 Pro时,可优先将代码执行任务分配给其他模型,或在提示中加强约束条件以降低波动影响。工程判断50.00分表明模型对技术方案优劣的评估能力出现明显不稳定,依赖该判断做架构决策的场景需谨慎。

战略判断

基于单日对比,Gemini 2.5 Pro代码执行能力被本次题目抽签放大,实际退化证据不足。主榜81.53分仍处于可用区间,但连续两日同类维度出现大幅波动时需重点验证。材料约束与任务表达的上升,显示模型在非代码维度保持韧性。

建议下一期Smoke评测重点观察代码执行与工程判断是否回升。若两维度持续低于80分,则需考虑模型在该类任务上的真实稳定性下降。当前数据不支持对Gemini 2.5 Pro整体能力下调结论,仅提示在代码密集场景增加冗余验证。


数据来源:赢政指数 (YZ Index) | Run #318 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!