一个模型家族,两个金牌级突破:IOI 与 IMO 的微调实践
国际信息学奥林匹克竞赛(IOI)与国际数学奥林匹克竞赛(IMO)考察的核心能力截然不同。IOI 要求算法代码在严格的时间和提交限制下通过隐藏测试;而 IMO 则强调严谨的自然语言证明。在任一比赛中夺金已属不易,若能在两项赛事中均达到金牌水平,则意味着更广泛的能力突破。

最新研究显示,Nemotron 系列模型具备强大的基础适应性。研究团队基于 Nemotron 3,结合监督微调(SFT)、强化学习(RL)及推理时计算策略,成功构建了在 IMO 2026 和 IOI 2026 中达到金牌水平的系统。
| 比赛项目 | 模型配置 | 结果 |
|---|---|---|
| IOI 2026 | Nemotron-3-Ultra-CC(使用 SFT 和 GenCorrect) | 得分 535.4/600,超过金牌门槛 361.12,高于人类最高分 498.27 |
| IMO 2026 | Nemotron 3 Ultra General(生成-验证-精炼系统中的 SFT 和 RL 检查点) | 得分 30/42,超过官方金牌门槛 29 |
IOI 的成绩源自实时、前置的运行过程,条件与人类参赛者相同,包括时间、互联网接入及提交限制。该基准为非官方且无监督性质,未列入 IOI 官方排名。IMO 系统的解答则由官方评分员进行评定。
可复用的专业化训练配方
“易于微调”不仅指检查点可供训练,更意味着一个强大的基础模型能通过清晰、可复用的流程适应高难度领域。
上述两个项目均遵循以下四步方法:
- 以强大的 Nemotron 基座模型为起点。
- 构建特定领域的问题集及高质量推理轨迹。
- 采用标准后训练方法,如 SFT,并在必要时引入 RL。
- 将专家模型与推理循环配对,执行候选答案的生成、评估与改进。
尽管训练和推理的计算量巨大,但核心方法成熟且可复现。无需为每个挑战重新构建基础模型,只需对 Nemotron 进行针对性专业化处理。
从通用编码能力到 IOI 金牌
针对竞争性编程,团队策划了 22,000 个问题并生成合成推理轨迹,用于训练两个专家模型。拥有 300 亿总参数和 30 亿活跃参数的 Nemotron-3-Nano-CC 经过 SFT 和 RL 训练;拥有 5500 亿总参数和 550 亿活跃参数的 Nemotron-3-Ultra-CC 仅经过 SFT 训练。
专业化带来的性能提升显著。Nano 模型得分从训练后的 130 分提升至 SFT 后的 280 分,再经 RL 优化至 291 分。配合“生成-评估-精炼”策略 GenCorrect,其得分达到 468 分,超越 438.3 分的金牌门槛。Ultra-CC 模型在相同测试时策略下得分为 502 分。
实验表明,不同规模模型的适配路径存在差异。SFT 为 Nano 模型带来主要收益,RL 提供小幅但稳定的改进。对于更强的 Ultra 模型,单轮 SFT 即可在 IOI、ICPC 和 LiveCodeBench Pro 上超越完全训练后的 Nano 模型。在 IOI 2026 中使用的竞争专用 Ultra-CC 系统最终获得 535.4/600 的高分。
赋予 Nemotron 证明、检查与修正能力
IMO 项目将类似思路应用于奥林匹克数学。团队基于 Nemotron 3 Ultra 分别训练了 SFT 专家和 RL 专家。
SFT 语料库包含 414,890 个经质量筛选的样本,覆盖 15,818 道独特证明题。数据不仅教授最终答案,还涵盖证明生成、优化、验证及元验证环节,使模型掌握论证构建、漏洞识别、批评回应及完整性判断。RL 模型则在 9,597 道位于模型能力边界附近的证明题上进行训练。
开发实验中,这两个后训练检查点表现优于通用可用模型。SFT 检查点在首轮搜索中表现最佳,而 RL 检查点在单检查点总体结果中领先。鉴于两者优势互补,最终系统结合了两位专家与通用模型。
针对每道 IMO 题目,模型生成候选证明,对其进行评分,产生批评意见,并完善最有潜力的尝试。随后由高级计算阶段选定最终提交内容。整个系统仅使用自然语言,不依赖形式化证明器、外部工具或互联网。该系统在 42 分满分中获得 30 分,其中六道题中有四道得分,超过官方金牌门槛。
微调与测试时计算的协同效应
此前关于 IOI 2025 的研究展示了测试时计算如何将开放权重模型推向金牌性能。新结果补充了关键一环:更好的专业化使得推理系统能提供更优质的候选解、更精准的批评者以及更有效的改进机制。
在 IOI 中,GenCorrect 将微调收益转化为多轮推理下的更大提升。在 IMO 中,组合互补的 SFT 和 RL 检查点比单纯增加单一检查点的采样数量更具价值。两种情况下,最佳结果均源于将有能力的专家模型与具备搜索、验证和改进功能的系统相结合。
这一区别至关重要。奖牌并非仅靠微调或粗暴采样获得,而是来自模型、数据与推理循环的共同设计。
开源模型、数据与方法
相关成果旨在服务于竞赛之外的应用场景。Nemotron Labs 发布了 IMO 2026 系列资源,包括 SFT 和 RL 检查点、两个训练数据集,以及包含 200 个奥运级别问题的新基准 Nemotron-IMO-Bench。IMO 论文详述了训练方法及生成-验证-改进系统,NeMo-Skills 仓库提供了 IMO 推理管道、提示词、提交的证明及可复现的快速启动指南。
针对竞争性编程,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上线,IOI 论文提供了训练配方和 GenCorrect 方法。IOI 评估及推理管道同样可在 NeMo-Skills 中获取。
IMO 和 IOI 的结果共同证实了一个简单观点:通过合理的专业化设计与推理增强,基础模型能够在极高难度的逻辑与数学任务中达到顶尖水平。





