DeepSeek V4 Pro在今日Smoke评测中,代码执行维度从昨日100.00分跌至75.00分,材料约束维度则从68.20分升至95.00分,主榜得分从85.69分变为84.00分。
数据事实:维度得分与主榜变化
代码执行维度单日下降25分,工程判断维度从94.50分降至75.00分,任务表达维度小幅回落4.7分至90.00分。材料约束维度上升26.8分,直接抵消了代码执行的损失,使主榜仅下降1.7分。诚信评级维持pass。
成因分析:题目抽签波动还是模型退化
Smoke评测每日仅10题,每维度2题,样本量极小,单日分数标准差天然较大。代码执行与工程判断同时出现19.5分以上跌幅,最可能原因是当日抽中的2道代码题难度显著高于昨日,模型在边界条件处理或多步推理链上出现失误。材料约束维度大幅上升,说明当日材料题可能更贴近模型训练分布,减少了幻觉或格式违规。
若为模型真实退化,通常会伴随多个维度同步且持续的下滑,而非出现材料约束的反向大幅提升。目前数据仅显示单日对立变化,缺乏连续多日同维度走弱的证据,因此更接近题目抽签波动。
对使用者的含义
重度依赖代码执行的团队,在调用DeepSeek V4 Pro时需增加本地测试环节,尤其在处理复杂算法或多文件交互场景时,单次75分表现可能导致生成代码通过率下降。材料约束95分则表明,该模型在严格遵循用户提供的文档或格式要求时表现更稳健,适合需要高保真输出的文档生成或数据抽取任务。
工程判断维度跌至75分,对需要模型辅助架构决策或代码审查的开发者而言,建议降低对单次输出的信任度,增加人工复核步骤。
战略判断
主榜仅降1.7分,掩盖了代码执行与工程判断的真实波动,说明当前主榜公式对材料约束权重较高。DeepSeek V4 Pro在代码执行上的单日表现已回到75分区间,若下期评测中该维度未能回升至90分以上,则需重点验证是否出现能力退化信号。目前仅凭单日数据,判定为正常抽样波动更合理。
代码执行75.00分与材料约束95.00分的对立走势,是本次评测最值得记录的现象。
对选型企业而言,DeepSeek V4 Pro仍可作为材料约束优先场景的候选模型,但在代码生成流水线中建议保留备选方案。下一期Smoke评测若代码执行与工程判断同时回升,则可确认本次为随机波动;若继续维持低位,则需进一步观察。
数据来源:赢政指数 (YZ Index) | Run #250 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接