一个模型家族,两项金牌级成果:微调 Nemotron 以应对 IOI 和 IMO

📌 One-Sentence Summary
NVIDIA 展示了一种可复用的配方,结合监督微调、强化学习和迭代推理循环,将 Nemotron 模型微调为在 IOI 和 IMO 竞赛中达到金牌水平的专家系统。
📝 Summary
NVIDIA 报告称,通过专门化 Nemotron 3 模型,其在国际信息学奥林匹克竞赛 (IOI) 和国际数学奥林匹克竞赛 (IMO) 中均达到了金牌水平。对于 IOI,他们整理了 22,000 道竞技编程题目来训练 Nemotron-3-Ultra-CC,采用监督微调 (SFT),并在推理时运用「GenCorrect」生成-评估-精炼策略,得分 535.4/600,超越了人类最高分。对于 IMO,他们在超过 400,000 个证明示例上训练了 SFT 和 RL 检查点,构建了一个无需形式化证明器即可生成、批评并完善自然语言证明的系统,得分 30/42,超过了金牌阈值。这些结果表明,成功源于模型专业化与测试时计算策略的协同设计,而非仅依赖其中一项。所有模型、数据集、基准测试和代码配方已在 Hugging Face 和 GitHub 上开源发布。
💡 Main Points
一种可复用的四步专业化配方使 Nemotron 在不同领域均达到了世界级性能。
该过程包括从强大的基础模型开始,策划包含高质量推理轨迹的特定领域数据,应用标准的后训练方法(SFT/RL),并将专家模型与一个生成、评估和改进答案的推理循环配对。
对于 IOI,结合 SFT 与 GenCorrect 迭代精炼策略使模型超越了人类最高分。
Nemotron-3-Ultra-CC 得分 535.4/600,超过了 361.12 的金牌阈值和 498.27 的人类最高分。进展显示,虽然 SFT 为较小模型提供了大部分增益,但较大模型需要更少的 epoch,却显著受益于如 GenCorrect 这样的测试时计算策略。
对于 IMO,利用了 SFT 和 RL 检查点的互补优势构建了一个生成-验证-精炼系统。
SFT 检查点在初始搜索轮次中表现出色,而 RL 检查点实现了更好的单检查点结果。在一个仅使用自然语言的流水线中(无形式化证明器)同时使用这两个检查点以及一个通用模型,最终得分为 30/42,击败了 29 分的官方金牌阈值。
成功需要将模型专业化与测试时计算协同设计,而非仅依靠其中之一。
奖牌并非仅由微调产生,也并非仅由暴力采样产生。更好的专业化能为推理循环提供更好的候选者和批评者,而推理循环则通过多轮反馈放大了微调带来的增益。
💬 Key Quotes
从 Nemotron 3 出发,我们的团队利用监督微调 (SFT)、强化学习 (RL) 和反馈驱动的推理,创建了能够在 2026 年 IMO 和 2026 年 IOI 中均达到金牌水平的系统。
IOI 的结果来自一次实时的、前瞻性的运行,其时间、互联网访问和提交约束条件与人类参赛者相同。
在 IOI 中,GenCorrect 将微调带来的增益转化为多轮反馈中的更大改进。在 IMO 中,使用互补的 SFT 和 RL 检查点比简单地从单个检查点抽取更多样本更有价值。
总之,IMO 和 IOI 为一个简单的理念提供了异常严苛的证据:Nemotron 可以被微调为世界级的领域专家,然后与透明的推理工作流组合,以解决处于人类竞赛前沿的问题。
📊 Article Meta
AI Screening: 86
Source: Hugging Face - Blog
Author: Aleksander, Igor Gitman, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar
Category: 人工智能
Language: 英文
Read Time: 4 min
Word Count: 978
Tags:
AI 与智能应用 , 模型训练与推理 , 强化学习 , 代码助手 , 开源项目
写得挺用心的,支持一下。
这个观点很中肯,深有同感。
实测过类似工具,作者说的基本属实。
楼主辛苦了,内容很有参考价值。