英伟达Nemotron-3-Ultra-CC在IOI 2026现场赛以535.4分超越人类最高分

2026年9月2日英伟达发布论文,Nemotron-3-Ultra-CC在IOI 2026现场赛以535.4分超过人类最高498.27分,成为首个在完整IOI题集上超越顶尖人类选手的AI系统。该系统在相同时间与提交规则下完成测试,论文同时披露了从问题筛选到GenCorrect测试时计算的完整后训练流程。

2026年9月2日,英伟达Nemotron团队在arXiv发布的论文显示,Nemotron-3-Ultra-CC系统在2026年国际信息学奥林匹克竞赛现场赛中获得535.4分,超过人类最高分的498.27分。

事实还原

论文编号arXiv:2609.02849记录了Nemotron-3-Ultra-CC(550B总参数/55B激活参数)在与人类选手完全相同的时限、互联网访问和提交规则下的表现。该系统得分535.4分,高于金牌线361.12分,也高于当届人类最高498.27分。论文指出,这是首个AI系统在完整IOI题集上实现这一结果。

同一论文还披露了Nemotron-3-Nano-CC(30B总参数/3B激活参数)在IOI 2025上的测试数据:基础模型130分,经监督微调后291分,加入GenCorrect后468分,超过该届金牌线438.3分。

机制拆解

论文描述的端到端流程包括大规模问题筛选、合成推理轨迹、监督微调与强化学习。Nemotron-3-Ultra-CC仅使用监督微调,Nano-CC则额外进行了强化学习。GenCorrect作为测试时策略,通过迭代生成、评估与精炼多样化解决方案来提升输出质量。

这些步骤均在论文给出的22,000个精选问题基础上展开,论文未提供各阶段的具体性能增益分解,但明确将GenCorrect列为从IOI 2025到2026成绩提升的关键组件。

产业影响

IOI作为国际公认的代码能力最高级别赛事,其现场赛规则与真实竞赛环境一致。此前AI系统多在ARC-AGI等评测中取得高分,但IOI的即时性与规则对等性使本次结果更难被质疑为评测偏差。

论文同时提及Nemotron-3-Nano-CC在IOI 2025已达到金牌水平,显示后训练 pipeline 在不同规模模型上的可迁移性。这为其他实验室提供了可参考的从数据 curation 到测试时计算的完整路径。

战略判断

(以下为分析而非事实)IOI现场赛的突破可能加速产业对“可验证规则下代码能力”的重视程度,与需要长期守约的复杂工程任务形成对照。企业可能重新评估现有基准的有效性,并增加对端到端后训练 pipeline 的投入。竞争格局中,拥有大规模合成数据与强化学习资源的公司将获得相对优势,但实际商业落地仍需观察多轮迭代后的稳定性。

论文未披露训练成本与能耗数据,未来若多家机构跟进同类实验,资源门槛可能进一步抬高。