豆包Pro代码执行暴跌16.7分 材料约束却升30.6分

豆包 Pro 在今日 Smoke 评测中,代码执行维度得分从昨日 91.70 分跌至 75.00 分,降幅 16.7 分;材料约束维度从 69.40 分升至 100.00 分,增幅 30.6 分;主榜得分从 81.67 分升至 86.25 分,增幅 4.6 分。

得分对比的直接事实

工程判断维度从 63.90 分升至 100.00 分,增幅 36.1 分;任务表达维度从 100.00 分降至 91.70 分,降幅 8.3 分。诚信评级保持 pass。Smoke 评测每日仅 10 题,2 题 per 维度,单日波动属正常范围。

成因分析:题目抽签波动而非模型真实退化

代码执行与材料约束两个主榜维度出现方向完全相反的剧烈变化,代码执行下降 16.7 分的同时材料约束上升 30.6 分,工程判断也同步上升 36.1 分。这种对立走势最可能源于每日题目抽签的难度与类型差异。Smoke 评测题库有限,单日 10 题的随机组合容易让模型在某一维度遇到更难的代码执行案例,同时在材料约束和工程判断上遇到更易得分的案例。

若为模型真实能力退化,通常会伴随多个维度同步或同向下降,而非出现工程判断与材料约束同时大幅提升的情况。任务表达仅小幅下降 8.3 分,进一步印证整体能力未出现系统性下滑。主榜得分反而上升 4.6 分,也与代码执行单一维度暴跌形成对比,说明材料约束的满分拉升作用超过了代码执行的损失。

对使用者的具体含义

重度依赖代码执行的开发团队需注意,今日 75.00 分水平意味着在 Smoke 评测同类代码任务上,豆包 Pro 完成率或准确率出现明显回落。需要为关键代码生成任务增加人工复核环节,尤其在需要连续多步调试或复杂算法实现的场景。

对材料忠实度要求高的场景,今日 100.00 分表现则提供正面信号,模型在遵循给定材料、避免幻觉输出方面达到满分水准。工程判断 100.00 分同样表明,在需要工程权衡的决策类问题上,今日抽中的题目让豆包 Pro 表现出色。

战略判断

基于今日得分对比,豆包 Pro 的 Smoke 评测结果主要受题目抽签波动驱动,而非模型真实退化。主榜得分上升 4.6 分的事实,显示单一维度暴跌并未改变整体排名位置。需要下期验证的信号是:若连续多日代码执行维度维持在 75 分附近,则需重新评估模型在该维度的稳定性。

目前数据不支持将本次暴跌解读为能力永久下滑。选型企业可继续观察后续 Smoke 评测中代码执行与材料约束的配对走势,以确认波动是否收敛。


数据来源:赢政指数 (YZ Index) | Run #295 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!