AIレビュー

実機テスト、データで語る。厳密な方法論でAI大規模モデル、スマートハードウェア、最先端技術を評価し、最も客観的な参考を提供します。

🏠 自社レビュー LMSYS Chatbot Arena MLCommons Ars Technica

Gemini 2.5 Pro时区推理100分变0：大模型的常识盲区有多可怕

Gemini 2.5 Pro在最新评测中遭遇滑铁卢：时区推理题从满分直接跌至0分，综合评分下降2.9分。这道看似简单的题目暴露了大模型在处理现实世界常识问题时的致命缺陷。