Today for AI

Hugging Face Blog · 2026/10/7 12:45:31

NVIDIA 微调 Nemotron 模型,在 IOI 与 IMO 竞赛中获金牌级表现

原标题:One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
68AI 研判分
核心综述

NVIDIA 团队通过微调 Nemotron 模型家族,使其在国际信息学奥赛(IOI)和国际数学奥林匹克(IMO)中均达到金牌水平。该成果证明了通用大模型经领域特定微调后,结合透明推理工作流,可解决人类竞赛前沿难题。

报道全文原始报道全文

本文目录6 个章节

返回文章列表

一个模型家族,两项金牌级成果:针对 IOI 和 IMO 微调 Nemotron

企业 + 文章 发布于 2026 年 10 月 7 日 点赞 3

Aleksander aficek nvidia Igor Gitman igitman nvidia Sean Narenthiran SeanNaren nvidia Mehrzad Samadi mehrzads nvidia Somshubra Majumdar smajumdar94 nvidia

国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考察的是不同的技能。IOI 要求算法和代码在严格的时间和提交限制下通过隐藏测试用例。IMO 则要求严谨的自然语言证明。在任何一项比赛中取得成功都极具挑战性。而在两项比赛中同时取得成功,则指向了更广泛的能力。

我们近期的结果表明,Nemotron 是构建世界级专家模型的强大且适应性强的基础。从 Nemotron 3 出发,我们的团队利用监督微调(SFT)、强化学习(RL)以及反馈驱动的推理,创建了能够在 IMO 2026 和 IOI 2026 中均达到金牌水平的系统。

fig_ioi_imo_gold_results_headline

比赛Nemotron 专业化方案结果
IOI 2026采用 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC535.4/600,高于 361.12 分的金牌分数线以及人类最高分 498.27 分
IMO 2026在生成-验证-精炼系统中使用 Nemotron 3 Ultra 通用版、SFT 和 RL 检查点30/42,高于官方金牌分数线 29 分

IOI 的结果来自一次实时的前瞻性运行,其时间、互联网访问权限和提交约束条件与人类参赛者完全相同。这是一项非官方的、无监督的基准测试,未包含在 IOI 的官方排名中。IMO 系统提交的证明由官方 IMO 评委进行评分。

可复用的专业化配方

“易于微调”不应仅仅意味着让一个检查点可训练。它应意味着一个强大的基础模型能够通过一套清晰、可复用的方案,适配到高要求的领域。

在这两个项目中,该方案包含四个部分:

  1. 以强大的 Nemotron 基础模型为起点。
  2. 精选领域特定问题及高质量推理轨迹。
  3. 应用标准的后训练方法,如监督微调(SFT),并在适用时结合强化学习(RL)。
  4. 将专家模型与一个推理循环配对,该循环负责生成、评估并改进候选答案。

尽管训练和推理过程规模庞大,但其底层方法成熟且可复现。我们无需为每个挑战重新构建基础模型,而是对 Nemotron 进行任务特化。

从通用编程能力到 IOI 金牌

针对竞赛编程,我们精选了 22,000 道题目,并生成合成推理轨迹以训练两个专家模型。Nemotron-3-Nano-CC(总参数 300 亿,激活参数 30 亿)同时接受了 SFT 和 RL 训练;Nemotron-3-Ultra-CC(总参数 5500 亿,激活参数 550 亿)仅接受 SFT 训练。

在 IOI 2025 上的表现进步直观地体现了特化的价值。Nano 在后训练前得分为 130 分,经 SFT 提升至 280 分,再经 RL 达到 291 分。借助 GenCorrect——我们的迭代式“生成-评估-精炼”策略——其得分升至 468 分,突破了 438.3 分的金牌门槛。Ultra-CC 采用相同的测试时策略达到了 502 分。

fig_main_capability_progression_previous_style

这些实验还表明,适配方式在不同规模下不必完全一致。对于 Nano,大部分增益来自 SFT,RL 则带来较小但稳定的提升。而对于更强的 Ultra 模型,仅需一个 SFT epoch 即可在 IOI、ICPC 和 LiveCodeBench Pro 上超越经过完整后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统的设计,该系统最终取得了 535.4/600 的成绩。

教会 Nemotron 证明、验证与修正

IMO 项目将同样的理念应用于奥林匹克数学。我们从 Nemotron 3 Ultra 出发,分别通过 SFT 和 RL 训练了两个专家模型。

SFT 语料库包含 414,890 个经过质量筛选的样本,涵盖 15,818 道独特的证明题。这些数据不仅用于教授最终答案,还覆盖了证明生成、优化、验证及元验证等环节,使模型学会了构建论证、识别漏洞、回应批评以及判断证明是否完整。RL 模型则在 9,597 道证明题上进行训练,这些题目均选自模型能力边界附近。

在开发实验中,两个后训练检查点(checkpoint)的表现均优于通用可用模型。SFT 检查点在首轮搜索中表现最强,而 RL 检查点则取得了最佳的单检查点整体结果。由于两者的优势具有互补性,最终系统将这两个专用模型与通用模型结合使用。

针对每道 IMO 题目,模型会生成候选证明、对其进行评分、提出批评意见,并优化最有潜力的尝试。随后,一个独立的高算力阶段负责选出最终提交的方案。整个系统完全基于自然语言运行,未使用形式化证明器、外部工具或互联网访问。该系统获得了 30 分(满分 42 分),其中六道题中有四道获得满分,超过了官方金牌分数线。

image

微调与测试时计算协同增效

我们此前发布的 IOI 2025 Hugging Face 博客文章展示了如何通过测试时计算将开源权重模型推向金牌水平的性能。最新的结果补充了一个重要观点:更好的专业化能为推理系统提供更优质的候选解、更精准的批评者以及更有效的优化过程。

在 IOI 中,GenCorrect 通过多轮反馈循环,将微调带来的增益转化为更大的性能提升。而在 IMO 中,结合互补的 SFT 和 RL 检查点比单纯从单一检查点采样更多结果更具价值。在这两种情况下,最佳成果都来自于将强大的专用模型与具备搜索、验证和改进能力的系统相结合。

这一区别至关重要。奖牌并非仅靠微调获得,也并非仅靠暴力采样获得,而是源于对模型、数据和推理循环的协同设计。

Hugging Face 上的开源模型、数据与配方

我们希望这些成果不仅限于竞赛本身。Nemotron Labs IMO 2026 合集整合了 SFT 和 RL 检查点、两个训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥赛级问题的新基准测试。IMO 论文详细阐述了训练方法及“生成-验证-精炼”系统,而 NeMo-Skills 代码库则包含了 IMO 推理流水线、提示词、提交的证明过程以及可复现的快速入门指南。在竞技编程方面,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上发布,IOI 论文提供了训练配方及 GenCorrect 方法论。IOI 的评估与推理流水线同样可在 NeMo-Skills 中获取。

综上所述,IMO 和 IOI 为这一简单理念提供了极具挑战性的实证:Nemotron 可以通过微调成为世界级的领域专家,并结合透明的推理工作流,解决处于人类竞赛前沿的问题。

我们非常期待看到 Hugging Face 社区接下来构建出什么成果。