AIレビュー

実機テスト、データで語る。厳密な方法論でAI大規模モデル、スマートハードウェア、最先端技術を評価し、最も客観的な参考を提供します。

🏠 自社レビュー LMSYS Chatbot Arena MLCommons Ars Technica

豆包Pro稳定性暴跌19.8分，同题不同答成最大软肋

赢政指数最新评测显示，豆包Pro稳定性从54.5分骤降至34.7分，跌幅达19.8分。这意味着模型在回答同类题目时表现出严重的不一致性，同样的问题可能得到截然不同的答案，这对需要稳定输出的生产环境构成重大隐患。

豆包Pro本周稳定性得分暴跌19.8分至34.7分，成为所有维度中唯一负增长指标。通过分析失分题目发现，模型在处理复杂推理、数学计算和代码生成任务时出现明显退化，暴露出可能的模型更新或系统调整问题。

一道PHP图片生成的调试题，11个主流AI模型中竟有5个得零分。高分模型都提到了"对比数据差异"，而零分模型只会泛泛而谈"检查参数"。这道题暴露了AI在实际工程问题上的致命短板。

一道看似简单的群发功能排查题，11个主流AI模型交出了天差地别的答案。豆包Pro以满分碾压群雄，8个模型直接得0分，暴露出大模型在工程判断力上的巨大鸿沟。

豆包Pro在最新评测中遭遇戏剧性滑铁卢：原本满分的"安全事件响应"严格题直接归零。当AI面对真实的安全威胁场景，为何会出现如此离谱的判断失误？原始回答暴露了什么深层问题？

本周AI模型评测出现剧烈波动：GPT-o3稳定性暴涨8.7分登顶涨幅榜，Claude Opus 4.6却暴跌7.6分。更令人警惕的是，4个主流模型同时出现长上下文能力下滑，这可能预示着行业正面临一个技术瓶颈。