ARC-AGI-3框架差异致GPT-6 Astra成绩现37点鸿沟

2026年9月3日ARC Prize发布报告显示,GPT-6 Astra在ARC-AGI-3上因测试框架不同得分出现37个百分点差距,标准harness为62.7%、Provider Adapter harness为99.9%。本文从事实还原、机制拆解、产业影响与战略判断四个层面分析这一基准可信度事件。

2026年9月3日ARC Prize发布的测试报告显示,GPT-6 Astra在ARC-AGI-3 Semi-Private任务集上,标准harness得分62.7%花费2.6万美元,Provider Adapter harness得分99.9%花费1.9万美元。

事实还原

报告明确区分两种harness:标准harness允许模型携带自身选择的笔记贯穿整个环境;Provider Adapter harness则保留不透明推理状态并使用压缩,支持跨请求复用先前工作。两种框架下模型均达到当前最优成绩,且在最高推理努力级别下动作效率优于人类中位数,96%的关卡使用动作少于人类。

机制拆解

成绩差异直接源于状态保留方式不同。标准harness要求模型每次请求仅依赖自身笔记,Provider Adapter harness允许模型内部状态持续存在并压缩长对话,从而减少重复推理开销。报告表格显示,随着推理努力从none到max提升,标准harness成本从4.9万美元降至2.6万美元,而Provider Adapter harness成本则从2.3万美元降至1.7万美元左右。

产业影响

该案例再次凸显评测口径对排名的决定作用。此前ExploitBench满分争议已引发类似质疑,此次事件进一步放大基准横向可比性的系统性问题。人类参与者测试成本约为每尝试一局12.78美元,而模型在高效推理下成本已接近或低于这一水平,但两种harness的公平性仍存争议。

战略判断

【分析】若基准制定者无法统一状态保留规则,未来各厂商可能倾向选择对自己有利的harness提交成绩,导致公开榜单参考价值下降;采用标准harness的跨厂商比较更接近真实部署场景,但短期内可能降低模型在复杂任务上的展示上限。