DeepSeek V4 Pro材料约束暴跌18.4分,代码执行反升11.1分

DeepSeek V4 Pro在今日Smoke评测中,材料约束得分从昨日81.70分直接跌至63.30分,降幅达到18.4分,主榜整体从82.64分降至80.46分,仅下滑2.2分。

得分拆解与直接证据

代码执行维度从83.40分升至94.50分,涨幅11.1分;工程判断从75.00分跌至50.00分,降幅25分;任务表达从75.00分降至66.70分,降幅8.3分。诚信评级维持pass。以上全部数据来自同一场每日10题Smoke快测,2题/维度。

波动成因分析

Smoke评测单日仅2题覆盖材料约束维度,一道题目答错即可拉低该维度20-30分。材料约束得分暴跌最可能源于当日抽中的两道题目对来源忠实度要求更高,模型出现一次明显幻觉或过度改写。代码执行同时提升11.1分,说明模型整体推理能力未出现系统性退化,更多是特定约束任务上的抽签波动。

工程判断降幅25分同样指向题目难度抽签差异,而非模型参数改变。主榜仅下滑2.2分,正是代码执行与材料约束两项对冲后的结果,证明单一维度剧烈波动在小样本快测中属于正常统计现象。

对使用者的具体含义

重度依赖材料约束的RAG系统或企业知识库团队,今日需对DeepSeek V4 Pro输出进行额外人工校验,尤其涉及引用原文、避免编造细节的场景。代码执行得分上升则表明,该模型在算法实现、数据处理脚本生成任务上表现更稳。

对同时需要工程判断的开发者而言,今日50.00分表现提示在架构评审或方案取舍类提示词下,模型输出一致性下降,应暂时切换至其他模型或增加多轮确认步骤。

战略判断

基于现有得分对比,材料约束18.4分跌幅最可能由题目抽签波动导致,而非模型真实退化。代码执行反向提升进一步支持这一判断。单日数据不足以确认趋势,建议下一期Smoke评测继续观察材料约束是否回升至80分区间。若连续两日保持低位,再考虑调整生产环境调用策略。

目前主榜80.46分仍处于可用区间,对稳定性要求不高的轻量任务可继续使用,对材料忠实度敏感的场景则需增加验证环节。


数据来源:赢政指数 (YZ Index) | Run #292 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!