豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分

豆包Pro在今日Smoke评测中,材料约束得分从昨日的85.90分降至58.30分,降幅达到27.6分,同时代码执行得分从50.00分升至99.30分,升幅49.3分,主榜得分从66.16分升至80.85分。

数据事实拆解

Smoke评测每日仅10题,每维度2题。材料约束与代码执行构成主榜,工程判断与任务表达为侧榜。今日材料约束58.30分、代码执行99.30分,主榜80.85分;昨日材料约束85.90分、代码执行50.00分,主榜66.16分。工程判断从100.00分跌至44.50分,任务表达从91.70分升至95.00分。诚信评级维持pass。

成因分析:抽签波动还是模型退化

每日2题的材料约束维度,单题失误即可造成20-30分级波动。今日材料约束58.30分对应可能出现多题未能严格遵循给定材料的情况,而昨日85.90分则显示较高材料忠实度。代码执行从50.00分跃升至99.30分,同样指向题目抽签差异:昨日2题可能涉及复杂调试或边缘错误,今日2题可能为标准实现题。工程判断(侧榜,AI辅助评估)跌幅55.5分,进一步印证单日题目对侧榜维度的放大效应。综合看,两个核心维度反向剧烈变动,最可能由题目抽签波动导致,而非模型参数层面真实退化。

对使用者的含义

重代码执行的团队在今日数据下可获得更高通过率,但对材料忠实度敏感的场景(如合同抽取、政策解读)需额外人工校验。依赖工程判断(侧榜,AI辅助评估)的原型验证流程可能面临更高返工风险。任务表达95.00分相对稳定,对输出格式要求较高的文案场景影响较小。选型企业应将今日80.85分主榜视为高波动样本,而非稳定能力基准。

战略判断

主榜80.85分由代码执行99.30分拉动,材料约束58.30分已低于昨日水平。单日反向波动幅度超过45分,表明当前测试样本量不足以区分抽签噪声与真实能力变化。下一期Smoke评测若材料约束继续低于70分,则需提高关注优先级;若代码执行回落而材料约束回升,则今日数据更可能为极端抽签结果。基于现有对比,豆包Pro主榜提升主要来自代码执行维度,材料约束的持续跟踪是判断其稳定性的关键信号。

工程判断(侧榜,AI辅助评估)44.50分与材料约束58.30分同时走低,提示模型在需要严格约束与工程决策的复合任务上可能存在一致性不足。开发者在构建需要多轮材料核对的流程时,应预留人工复核节点。主榜得分80.85分虽高于昨日,但构成该得分的两个维度差异达41分,说明单一主榜数字掩盖了内部不均衡。

诚信评级维持pass,表明模型未出现系统性幻觉或拒绝回答问题。稳定性维度未在本期数据中提供,无法直接评估分数标准差。使用者可通过连续三日Smoke数据计算材料约束的标准差,以判断是否进入高波动区间。

总体而言,今日数据最直接的解读是抽签波动主导。材料约束暴跌与代码执行暴涨并存,尚未构成模型真实退化的充分证据,但已构成需要下一期数据验证的信号。重材料约束场景的团队应暂缓扩大部署规模,等待材料约束得分回稳。


数据来源:赢政指数 (YZ Index) | Run #312 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!