DeepSeek V4 Pro材料约束55.60分代码执行维度缺失 Smoke测试主榜排名落空

DeepSeek V4 Pro在今日Smoke评测中代码执行维度数据缺失,材料约束得分55.60分,主榜因此无法参与排名。

数据事实:维度得分与缺失情况

今日得分对比显示,代码执行维度完全无数据,材料约束维度得分为55.60分,工程判断(侧榜,AI辅助评估)为50.00分,任务表达(侧榜,AI辅助评估)为62.50分。昨日所有维度均无得分记录,本期主榜整体标记为缺失。

成因分析:API故障与题目抽签波动的区分

材料约束维度55.60分与工程判断50.00分的出现,指向API调用在执行环节中断。代码执行维度要求模型直接运行代码并返回结果,API超时会直接导致该维度数据为空,而材料约束仅需文本层面对齐,因此仍能产出55.60分。任务表达62.50分高于工程判断,说明模型在指令复述类题目上相对稳定,但工程判断涉及多步逻辑链,50.00分显示其在侧榜评估中一致性不足。

Smoke评测每日仅2题/维度,题目抽签本身存在随机性。若模型真实退化,通常会伴随材料约束与任务表达同步下降,而本次仅执行维度缺失,其他维度仍有数值,指向API故障而非模型能力整体下滑。稳定性维度衡量分数标准差,本期因执行维度缺测,无法计算标准差,因此无法判断其一致性水平。

对使用者的含义

重代码执行的团队在调用DeepSeek V4 Pro时需增加超时重试机制,55.60分的材料约束得分表明其在文档忠实度场景下仍有可用性,但执行环节的缺失会直接影响代码生成类应用。依赖该模型的开发者应优先验证API可用性,再评估工程判断50.00分对复杂任务的影响。

对材料忠实度敏感的场景,55.60分提供了一个可量化的基准;若任务同时需要代码运行验证,则本期数据不足以支撑选型决策。

战略判断

基于现有得分对比,DeepSeek V4 Pro本期异常主要由API故障导致,而非模型真实退化。主榜排名落空这一结果值得下期继续验证执行维度是否恢复。工程判断50.00分与任务表达62.50分的差距,提示侧榜能力存在内部不均衡,需在后续完整数据中进一步观察。

诚信评级未在本期数据中显示异常,暂不影响准入门槛判断。稳定性与可用性作为运行信号,本期因数据不完整,无法给出具体分值。


数据来源:赢政指数 (YZ Index) | Run #279 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!