英伟达Nemotron-3-Ultra-CC在IOI 2026现场赛以535.4分超越人类最高分
2026年9月2日,英伟达Nemotron团队在arXiv发布的论文显示,Nemotron-3-Ultra-CC系统在2026年国际信息学奥林匹克竞赛现场赛中获得535.4分,超过人类最高分的498.27分。
事实还原
论文编号arXiv:2609.02849记录了Nemotron-3-Ultra-CC(550B总参数/55B激活参数)在与人类选手完全相同的时限、互联网访问和提交规则下的表现。该系统得分535.4分,高于金牌线361.12分,也高于当届人类最高498.27分。论文指出,这是首个AI系统在完整IOI题集上实现这一结果。
同一论文还披露了Nemotron-3-Nano-CC(30B总参数/3B激活参数)在IOI 2025上的测试数据:基础模型130分,经监督微调后291分,加入GenCorrect后468分,超过该届金牌线438.3分。
机制拆解
论文描述的端到端流程包括大规模问题筛选、合成推理轨迹、监督微调与强化学习。Nemotron-3-Ultra-CC仅使用监督微调,Nano-CC则额外进行了强化学习。GenCorrect作为测试时策略,通过迭代生成、评估与精炼多样化解决方案来提升输出质量。
这些步骤均在论文给出的22,000个精选问题基础上展开,论文未提供各阶段的具体性能增益分解,但明确将GenCorrect列为从IOI 2025到2026成绩提升的关键组件。
产业影响
IOI作为国际公认的代码能力最高级别赛事,其现场赛规则与真实竞赛环境一致。此前AI系统多在ARC-AGI等评测中取得高分,但IOI的即时性与规则对等性使本次结果更难被质疑为评测偏差。
论文同时提及Nemotron-3-Nano-CC在IOI 2025已达到金牌水平,显示后训练 pipeline 在不同规模模型上的可迁移性。这为其他实验室提供了可参考的从数据 curation 到测试时计算的完整路径。
战略判断
(以下为分析而非事实)IOI现场赛的突破可能加速产业对“可验证规则下代码能力”的重视程度,与需要长期守约的复杂工程任务形成对照。企业可能重新评估现有基准的有效性,并增加对端到端后训练 pipeline 的投入。竞争格局中,拥有大规模合成数据与强化学习资源的公司将获得相对优势,但实际商业落地仍需观察多轮迭代后的稳定性。
论文未披露训练成本与能耗数据,未来若多家机构跟进同类实验,资源门槛可能进一步抬高。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接