Nemotron 系列微调后达到 IOI 2026 与 IMO 2026 金牌水平

📌 One-Sentence Summary
NVIDIA Nemotron 团队通过结合专门微调(SFT/RL)与反馈驱动推理循环,在 IOI 和 IMO 2026 中实现了金牌级表现。
📝 Summary
NVIDIA 的 Nemotron 团队证明,单一模型家族可以适应不同领域并达到世界顶尖水平:竞赛编程(IOI)和数学证明生成(IMO)。通过应用监督微调(SFT)、强化学习(RL)以及 GenCorrect 等迭代推理策略,他们构建了在 IOI 中得分 535.4/600、在 IMO 中得分 30/42 的系统,超越了官方金牌分数线。该方法凸显了领域特定后训练与测试时计算之间的协同效应,其中更好的专用模型为推理循环提供了更高质量的候选方案。所有模型、数据集和训练配方均在 Hugging Face 上开源,以鼓励社区复现和扩展。
💡 Main Points
通过统一配方在多样化领域实现金牌级表现
团队成功应用了一致的四步方法论——从强大的基础模型开始,整理领域数据,应用 SFT/RL,并配合推理循环——从而在 IOI(编码)和 IMO(数学证明)中都获得了最高分,展示了 Nemotron 的适应性。
微调与测试时计算的协同效应
结果表明,奖牌并非仅靠微调或暴力采样获得。专用模型提供了更好的初始候选方案和评判器,这显著增强了如 GenCorrect 等迭代优化策略在推理过程中的有效性。
SFT 和 RL 的不同缩放行为
对于较小模型(Nano),RL 在 SFT 之后提供了增量收益。对于较大模型(Ultra),单轮 SFT 足以超越完全后训练的小模型,这表明根据模型规模不同存在不同的优化路径。
通过开放资源实现完全可复现性
NVIDIA 发布了特定的检查点、训练数据集(包括 41.4 万条 IMO 样本)、基准测试(Nemotron-IMO-Bench)和代码仓库(NeMo-Skills),以便社区复现并在这些前沿结果基础上进行构建。
💬 Key Quotes
「这些奖牌并非仅由微调产生,也并非仅由暴力采样产生。它们源于模型、数据和推理循环的共同设计。」
「易于微调不应仅仅意味着使检查点可训练。它应意味着一个能力强的基础模型可以通过清晰、可复用的配方适应要求苛刻的领域。」
「该系统得分为 42 分中的 30 分,在六道题中的四道获得满分,超过了官方金牌分数线。」
📊 Article Meta
AI Screening: 88
Source: AIHOT — 精选
Author: noreply@aihot.news (Hugging Face 社区博客)
Category: 人工智能
Language: 英文
Read Time: 9 min
Word Count: 2178
Tags:
AI 与智能应用 , 模型训练与推理 , 强化学习 , 开源项目 , LLM 推理优化
整理得太全面了,省了我不少时间。
楼主辛苦了,内容很有参考价值。
内容翔实,正好需要,先收藏再看。
实测过类似工具,作者说的基本属实。
这个观点很中肯,深有同感。
思路清晰,干货满满。