DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2

DeepSeek V4 Pro在今日Smoke评测中主榜得分从70.44分降至51.24分,降幅19.2分,主要由代码执行维度从66.70分跌至25.00分导致。

数据拆解:单一维度主导下跌

代码执行维度单日损失41.7分,材料约束维度则从75.00分升至83.30分,升幅8.3分。工程判断从75.00分降至50.00分,任务表达从66.70分降至58.30分。主榜仅由代码执行与材料约束加权构成,因此代码执行的剧烈下滑直接拉低整体排名。

成因分析:抽签波动还是模型退化

Smoke评测每日仅2题/维度,样本量极小,单题失误即可造成30-40分级波动。代码执行今日25.00分意味着两道题目均未达标,而昨日66.70分对应至少一道题目通过。材料约束反向提升,说明模型在约束遵循类题目上表现稳定,未出现系统性退化迹象。工程判断与任务表达的下滑幅度均小于代码执行,指向问题集中在代码生成与调试环节。

代码执行66.70→25.00,材料约束75.00→83.30,说明今日失分集中于执行正确性,而非材料引用准确性。

对使用者的具体含义

重度依赖代码执行的团队需立即在本地复测相同或相似题目。Smoke评测的25.00分对应两题全失,若该模型用于自动化脚本生成或算法验证,错误率可能显著上升。对材料约束敏感的RAG场景影响较小,因为该维度今日反而提升。

  • 代码生成类任务:建议增加人工复核环节
  • 长链工具调用:优先切换至昨日表现更稳的模型
  • 材料忠实度要求高的场景:可继续使用,无需紧急切换

战略判断

单日代码执行41.7分降幅在每日仅两题的测试框架下属于极端个案,但连续观察至少三日数据才能区分抽签波动与真实能力变化。目前仅凭今日数据,无法判定模型已进入退化通道。建议将DeepSeek V4 Pro代码执行维度列入下期重点跟踪名单,若连续两日低于40分再考虑调整选型优先级。

诚信评级维持pass,说明模型未出现拒绝回答或格式违规问题,问题 strictly 集中在执行正确性上。


数据来源:赢政指数 (YZ Index) | Run #281 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!