DeepSeek V4 Pro在今日Smoke评测中,材料约束得分从昨日91.70分降至76.70分,主榜得分则从55.02分升至75.77分。
得分变化拆解
代码执行从25.00分升至75.00分,材料约束从91.70分降至76.70分,两者加权后主榜净增20.75分。工程判断从88.90分跌至50.00分,任务表达从75.00分降至62.50分。诚信评级维持pass。
波动成因分析
Smoke评测每日仅2题/维度,单题得分权重极高。代码执行单日+50分,最可能源于今日抽中两道模型擅长的编程题目;材料约束-15分,则可能因抽中需要严格遵循原文约束的题目。工程判断-38.9分同样指向题目难度或主题与模型当前响应风格的匹配度变化,而非模型参数级退化。
今日主榜提升主要由代码执行单维度拉动,材料约束的下降被部分抵消。
对使用者的含义
重代码执行的团队可继续使用DeepSeek V4 Pro处理编程任务,今日75.00分已接近较高水平。对材料忠实度敏感的场景,如合同抽取、政策解读,76.70分意味着输出可能出现更多偏离原文的表述,需增加人工校验环节。
- 开发者在调用API时,可优先在代码生成类prompt上测试稳定性。
- 内容生产团队应在材料约束维度低于80分时,增加引用原文的prompt约束。
战略判断
当前数据仅显示单日抽样波动,材料约束与工程判断的同步下降值得下期验证。若连续两日材料约束维持在80分以下,则需考虑模型在约束遵循上的真实变化。主榜75.77分已超过昨日水平,短期内无需下调使用优先级。
工程判断50.00分与任务表达62.50分均属侧榜,暂不影响主榜排名,但对需要复杂判断的场景构成额外风险。
数据来源:赢政指数 (YZ Index) | Run #330 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接