DeepSeek V4 Pro在今日Smoke评测中,材料约束维度得分从昨日100.00分降至68.20分,降幅31.8分;代码执行维度则从69.50分升至100.00分,升幅30.5分。
数据事实:主榜微升掩盖维度剧震
主榜得分从83.23分升至85.69分,净增2.46分。工程判断从100.00分降至94.50分,任务表达从100.00分降至94.70分。诚信评级维持pass。
Smoke评测每日仅2题/维度,单日样本量极小。材料约束与代码执行两项出现近乎对称的30分级反向移动,指向题目抽签随机性而非模型能力结构性退化。
成因分析:抽样波动而非真实退化
材料约束昨日满分、今日68.20分,差值31.8分;代码执行昨日69.50分、今日100.00分,差值30.5分。两维度变化幅度接近、方向相反,最可能解释是当日抽到的2道材料约束题目难度或约束要求显著高于昨日,而代码执行题目则相对简单。
工程判断与任务表达各降5.5分和5.3分,幅度远小于主维度,符合小样本噪声特征。若模型出现系统性材料忠实度退化,通常会伴随代码执行同步下滑,而非出现30.5分对冲性上涨。
对使用者的含义
重度依赖材料引用的企业或开发者,今日68.20分意味着在需要严格忠实原始文本的场景中,单次调用失败概率明显上升。需要增加人工复核环节或多轮验证。
以代码执行为主的团队则可获得更高确定性,今日100.00分显示该模型在算法实现、调试任务上已达到满分水准,可优先考虑用于代码生成流水线。
战略判断
单日31.8分材料约束下跌属于Smoke评测正常波动区间,不构成立即下调评级的依据。主榜仍实现正增长,说明代码执行的满分贡献已完全覆盖材料约束损失。
若下期材料约束得分继续停留在70分以下区间,且代码执行维持高位,则需验证是否存在提示词模板或系统指令层面的材料处理机制变化。目前数据仅支持“抽样导致”的结论,不支持“模型退化”判断。
数据来源:赢政指数 (YZ Index) | Run #248 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接