豆包 Pro 在今日 Smoke 评测中 execution、grounding、judgment、integrity、communication 五维度得分全部显示为-,主榜得分同样为-,该模型因 API 故障/超时未完成任何题目作答,本期不参与排名。
数据事实:零记录源于 API 中断
得分对比表显示昨日与今日全部维度均为-,没有任何数值产生。这表明评测流程在调用阶段即已终止,并非模型对 10 题作答后出现分数波动。Smoke 评测每日仅 2 题/维度,单日波动正常,但完全无返回结果的情况仅见于 API 超时或服务端拒绝响应。
成因分析:技术调用失败而非模型退化
题目抽签波动通常表现为已完成作答后分数在相邻区间小幅移动,而本次五维度同时缺失,指向调用链路在请求发出后即中断。API 故障/超时记录直接指向服务可用性问题,而非模型对代码执行或材料约束任务的理解能力下降。工程判断与任务表达两个侧榜维度同样缺失,进一步确认中断发生在模型推理之前。
API 故障导致的零记录,与模型多次回答同类题目时分数标准差增大所造成的稳定性下降,机制完全不同。
对使用者的含义
重代码执行的团队在生产环境中调用豆包 Pro 时,需额外监控 API 响应成功率。材料约束敏感的场景同样面临请求被拒绝的风险,可能导致工作流中断。开发者依赖该模型进行连续任务时,单次超时可能引发整个批处理失败,增加重试与降级逻辑的开发成本。
- 对选型企业:将豆包 Pro 作为主模型时,需准备备用 API 端点或本地缓存策略。
- 对依赖该模型的开发者:当前 Smoke 评测中断信号提示,日常调用应加入超时重试与健康检查。
战略判断
本次事件仅反映 API 可用性问题,不构成模型能力退化的证据。主榜未获得任何分数,因此无法比较代码执行或材料约束的真实水平。下一期 Smoke 评测若仍出现类似缺失,需重点验证 API 稳定性;若恢复正常作答,则本次中断可视为偶发技术故障,无需调整对豆包 Pro 核心能力的评估。
基于现有得分对比,豆包 Pro 本期缺席排名是由调用层故障直接导致,不涉及模型内在表现变化。企业与开发者应将关注点放在 API 可用性监控上,而非模型本身的分数波动。
数据来源:赢政指数 (YZ Index) | Run #268 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接