DeepSeek V4 Pro代码执行暴跌25分,材料约束反升26.8分

DeepSeek V4 Pro在今日Smoke评测中,代码执行维度从昨日100.00分跌至75.00分,材料约束维度则从68.20分升至95.00分,主榜得分从85.69分变为84.00分。

数据事实:维度得分与主榜变化

代码执行维度单日下降25分,工程判断维度从94.50分降至75.00分,任务表达维度小幅回落4.7分至90.00分。材料约束维度上升26.8分,直接抵消了代码执行的损失,使主榜仅下降1.7分。诚信评级维持pass。

成因分析:题目抽签波动还是模型退化

Smoke评测每日仅10题,每维度2题,样本量极小,单日分数标准差天然较大。代码执行与工程判断同时出现19.5分以上跌幅,最可能原因是当日抽中的2道代码题难度显著高于昨日,模型在边界条件处理或多步推理链上出现失误。材料约束维度大幅上升,说明当日材料题可能更贴近模型训练分布,减少了幻觉或格式违规。

若为模型真实退化,通常会伴随多个维度同步且持续的下滑,而非出现材料约束的反向大幅提升。目前数据仅显示单日对立变化,缺乏连续多日同维度走弱的证据,因此更接近题目抽签波动。

对使用者的含义

重度依赖代码执行的团队,在调用DeepSeek V4 Pro时需增加本地测试环节,尤其在处理复杂算法或多文件交互场景时,单次75分表现可能导致生成代码通过率下降。材料约束95分则表明,该模型在严格遵循用户提供的文档或格式要求时表现更稳健,适合需要高保真输出的文档生成或数据抽取任务。

工程判断维度跌至75分,对需要模型辅助架构决策或代码审查的开发者而言,建议降低对单次输出的信任度,增加人工复核步骤。

战略判断

主榜仅降1.7分,掩盖了代码执行与工程判断的真实波动,说明当前主榜公式对材料约束权重较高。DeepSeek V4 Pro在代码执行上的单日表现已回到75分区间,若下期评测中该维度未能回升至90分以上,则需重点验证是否出现能力退化信号。目前仅凭单日数据,判定为正常抽样波动更合理。

代码执行75.00分与材料约束95.00分的对立走势,是本次评测最值得记录的现象。

对选型企业而言,DeepSeek V4 Pro仍可作为材料约束优先场景的候选模型,但在代码生成流水线中建议保留备选方案。下一期Smoke评测若代码执行与工程判断同时回升,则可确认本次为随机波动;若继续维持低位,则需进一步观察。


数据来源:赢政指数 (YZ Index) | Run #250 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!