Multi-Reward RL, Part 3: GDPO + CISPO + REPO-R at 27B, and the Advantage Floor That Stopped Learning

📌 One-Sentence Summary
本研究探索了不同的奖励聚合和策略优化方法(GDPO、CISPO、REPO-R)如何影响 27B 模型在结构化答案任务上的性能,揭示了虽然训练曲线看起来相似,但底层学习动态和泛化能力却大不相同,并且一个特定的 '优势下限' 保护机制导致了更难环境中的学习失败。
📝 Summary
这篇文章基于之前的工作,测试了奖励聚合(GDPO)和策略优化(CISPO、REPO-R)的多种组合对 27B 模型的影响。实验发现,用 CISPO 替换 DAPO 可以改善泛化,而添加 REPO-R 则进一步提升性能。最关键的发现是,一个旨在防止无效更新的 '保护' 机制在新的环境中过于激进,实际上阻断了 96% 的学习信号,阻止了模型的进步。
💡 Main Points
CISPO 优于 DAPO
通过限制令牌的重要权重而不是裁剪梯度,CISPO 允许进行更细致的更新,与标准 DAPO 方法相比,保留分数得到了显著改善,从 -0.47 提升到 -0.02。
REPO-R 增强探索
添加 REPO-R(根据令牌稀有度来缩放优势)可以防止策略坍缩为单一模式,导致了本次研究中最大的单步提升(从 -0.02 提升到 +1.33)。
'优势下限' 陷阱
一个安全保护机制,当核心分数低于一定阈值时将优势设为零,在新的环境中被发现过于激进,有效地阻断了 96% 的学习信号,并阻止了模型进行优化。
💬 Key Quotes
同样的模型,同样的奖励,同样的 600 个步骤。保留分数从 DAPO 的 -0.47,上升到 CISPO 的 -0.02,再到 CISPO + REPO-R 的 +1.33,最后在较小、过滤后的提示集上达到 +1.80。
📊 Article Meta
AI Screening: 90
Source: DEV Community: machinelearning
Author: Aleksei Romanov
Category: 人工智能
Language: 英文
Read Time: 10 min
Word Count: 2495
Tags:
AI 与智能应用 , 强化学习 , 大语言模型 (LLM) , 模型训练与推理 , 学习方法
刚好最近在找这方面的资料,太及时了。