DeepSeek V4 Pro在今日Smoke评测中,代码执行维度从昨日98.70分跌至75.00分,降幅23.7分,主榜整体从91.46分下滑至86.25分。
得分对比数据
材料约束维度从82.60分升至100.00分,升幅17.4分。工程判断从100.00分降至88.90分,降幅11.1分。任务表达从81.70分升至91.70分,升幅10分。诚信评级维持pass。
成因分析:抽签波动还是真实退化
Smoke评测每日仅10题,每维度2题,单日分数标准差天然较大。代码执行维度本次丢分集中,可能源于抽中需要复杂多步调试或边缘case的题目,而昨日题目相对简单。材料约束维度反向升至满分,显示模型在引用约束和忠实度上本次表现稳定,两维度同时出现极端反向变化,更符合随机题目抽签导致的波动,而非模型参数或训练发生系统性退化。
工程判断维度下滑11.1分与代码执行维度同向,任务表达维度上升10分,两者部分抵消后主榜净跌5.2分。整体波动幅度仍在每日快测正常区间内。
对使用者的含义
重度依赖代码执行场景的企业,例如自动化脚本生成、算法原型验证团队,今日数据提示需增加人工复核环节,避免直接采纳低分状态下的输出。材料约束维度升至满分,对需要严格引用原文或避免幻觉的文档生成场景反而提供更高可信度。
工程判断维度降至88.90分,对需要架构决策或多方案权衡的项目,建议暂时切换至得分更稳定的模型进行交叉验证。
战略判断
基于单日对比,代码执行暴跌更可能由题目抽签波动造成,而非模型真实退化。连续两日以上同维度出现类似跌幅时才需重点关注本轮Smoke评测稳定性。当前数据不支持对DeepSeek V4 Pro代码能力进行长期下调判断。
数据来源:赢政指数 (YZ Index) | Run #232 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接