豆包 Pro 材料约束单日跌40.9分 代码执行升25分主榜下滑4.7

豆包 Pro 在今日 Smoke 评测中材料约束得分从90.90分降至50.00分,代码执行得分从75.00分升至100.00分,主榜整体从82.16分下滑至77.50分。

数据事实拆解

本次 Smoke 评测仅包含10题,每维度2题。材料约束维度今日得50.00分,较昨日90.90分下降40.9分;代码执行维度今日得100.00分,较昨日75.00分上升25分;工程判断保持75.00分不变;任务表达小幅升至91.70分。主榜仅由代码执行与材料约束加权构成,因此材料约束的大幅下跌直接拉低整体排名。

成因分析:抽签波动还是能力退化

Smoke 评测每日题目随机抽取,2题样本量极小,单题失误即可造成维度得分剧烈波动。材料约束昨日90.90分对应较高材料忠实度,今日50.00分则显示模型在两道 grounding 题目中可能出现明显偏离或遗漏。代码执行同时升至满分,说明今日抽到的代码题目难度或类型更匹配模型当前能力。工程判断与任务表达变化微弱,进一步印证波动主要集中在材料约束这一可审计维度。

若为真实退化,通常会伴随多维度同步下滑或诚信评级变化,但今日诚信评级仍为 pass,工程判断也未移动。因此,材料约束40.9分跌幅更可能源于题目抽签带来的样本方差,而非模型参数级退化。

对使用者的具体含义

重度依赖材料约束的 RAG 检索、企业文档问答、合同审查场景,今日数据提示需增加人工复核环节。代码执行满分则表明该模型在纯编程任务上当日表现稳定,适合临时代码生成需求。对同时需要 grounding 与代码能力的混合工作流,建议拆分模型调用或增加多轮验证。

战略判断

基于单日对比,豆包 Pro 主榜下滑4.7分主要由材料约束波动驱动,暂无证据支持持续退化。下一期 Smoke 评测若材料约束仍低于70分,则需提高关注优先级;若回升至80分以上,则可判定为偶然抽签事件。当前数据不支持对模型整体能力下调结论,但提醒依赖材料约束的团队在关键项目中保留多模型备份。


数据来源:赢政指数 (YZ Index) | Run #284 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!