一个模型家族,两项金牌级成果:微调 Nemotron 以应对 IOI 和 IMO

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-10-081417 阅读💛 249 收藏
一个模型家族,两项金牌级成果:微调 Nemotron 以应对 IOI 和 IMO

📌 One-Sentence Summary

NVIDIA 展示了一种可复用的配方,结合监督微调、强化学习和迭代推理循环,将 Nemotron 模型微调为在 IOI 和 IMO 竞赛中达到金牌水平的专家系统。

📝 Summary

NVIDIA 报告称,通过专门化 Nemotron 3 模型,其在国际信息学奥林匹克竞赛 (IOI) 和国际数学奥林匹克竞赛 (IMO) 中均达到了金牌水平。对于 IOI,他们整理了 22,000 道竞技编程题目来训练 Nemotron-3-Ultra-CC,采用监督微调 (SFT),并在推理时运用「GenCorrect」生成-评估-精炼策略,得分 535.4/600,超越了人类最高分。对于 IMO,他们在超过 400,000 个证明示例上训练了 SFT 和 RL 检查点,构建了一个无需形式化证明器即可生成、批评并完善自然语言证明的系统,得分 30/42,超过了金牌阈值。这些结果表明,成功源于模型专业化与测试时计算策略的协同设计,而非仅依赖其中一项。所有模型、数据集、基准测试和代码配方已在 Hugging Face 和 GitHub 上开源发布。

💡 Main Points

一种可复用的四步专业化配方使 Nemotron 在不同领域均达到了世界级性能。

该过程包括从强大的基础模型开始,策划包含高质量推理轨迹的特定领域数据,应用标准的后训练方法(SFT/RL),并将专家模型与一个生成、评估和改进答案的推理循环配对。

对于 IOI,结合 SFT 与 GenCorrect 迭代精炼策略使模型超越了人类最高分。

Nemotron-3-Ultra-CC 得分 535.4/600,超过了 361.12 的金牌阈值和 498.27 的人类最高分。进展显示,虽然 SFT 为较小模型提供了大部分增益,但较大模型需要更少的 epoch,却显著受益于如 GenCorrect 这样的测试时计算策略。

对于 IMO,利用了 SFT 和 RL 检查点的互补优势构建了一个生成-验证-精炼系统。

SFT 检查点在初始搜索轮次中表现出色,而 RL 检查点实现了更好的单检查点结果。在一个仅使用自然语言的流水线中(无形式化证明器)同时使用这两个检查点以及一个通用模型,最终得分为 30/42,击败了 29 分的官方金牌阈值。

成功需要将模型专业化与测试时计算协同设计,而非仅依靠其中之一。

奖牌并非仅由微调产生,也并非仅由暴力采样产生。更好的专业化能为推理循环提供更好的候选者和批评者,而推理循环则通过多轮反馈放大了微调带来的增益。

💬 Key Quotes

从 Nemotron 3 出发,我们的团队利用监督微调 (SFT)、强化学习 (RL) 和反馈驱动的推理,创建了能够在 2026 年 IMO 和 2026 年 IOI 中均达到金牌水平的系统。

IOI 的结果来自一次实时的、前瞻性的运行,其时间、互联网访问和提交约束条件与人类参赛者相同。

在 IOI 中,GenCorrect 将微调带来的增益转化为多轮反馈中的更大改进。在 IMO 中,使用互补的 SFT 和 RL 检查点比简单地从单个检查点抽取更多样本更有价值。

总之,IMO 和 IOI 为一个简单的理念提供了异常严苛的证据:Nemotron 可以被微调为世界级的领域专家,然后与透明的推理工作流组合,以解决处于人类竞赛前沿的问题。

📊 Article Meta

AI Screening: 86

Source: Hugging Face - Blog

Author: Aleksander, Igor Gitman, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 978

Tags:

AI 与智能应用 , 模型训练与推理 , 强化学习 , 代码助手 , 开源项目

#AI 与智能应用# 模型训练与推理# 强化学习# 代码助手# 开源项目

文章评论(4)

空向阳1 小时前

写得挺用心的,支持一下。

回复
暮拾贝2 小时前

这个观点很中肯,深有同感。

回复
墨沐雨2 小时前

实测过类似工具,作者说的基本属实。

回复
龙文博1 小时前

楼主辛苦了,内容很有参考价值。

回复