Multi-Reward RL, Part 3: GDPO + CISPO + REPO-R at 27B, and the Advantage Floor That Stopped Learning

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 902026-10-101126 阅读💛 48 收藏
Multi-Reward RL, Part 3: GDPO + CISPO + REPO-R at 27B, and the Advantage Floor That Stopped Learning

📌 One-Sentence Summary

本研究探索了不同的奖励聚合和策略优化方法(GDPO、CISPO、REPO-R)如何影响 27B 模型在结构化答案任务上的性能,揭示了虽然训练曲线看起来相似,但底层学习动态和泛化能力却大不相同,并且一个特定的 '优势下限' 保护机制导致了更难环境中的学习失败。

📝 Summary

这篇文章基于之前的工作,测试了奖励聚合(GDPO)和策略优化(CISPO、REPO-R)的多种组合对 27B 模型的影响。实验发现,用 CISPO 替换 DAPO 可以改善泛化,而添加 REPO-R 则进一步提升性能。最关键的发现是,一个旨在防止无效更新的 '保护' 机制在新的环境中过于激进,实际上阻断了 96% 的学习信号,阻止了模型的进步。

💡 Main Points

CISPO 优于 DAPO

通过限制令牌的重要权重而不是裁剪梯度,CISPO 允许进行更细致的更新,与标准 DAPO 方法相比,保留分数得到了显著改善,从 -0.47 提升到 -0.02。

REPO-R 增强探索

添加 REPO-R(根据令牌稀有度来缩放优势)可以防止策略坍缩为单一模式,导致了本次研究中最大的单步提升(从 -0.02 提升到 +1.33)。

'优势下限' 陷阱

一个安全保护机制,当核心分数低于一定阈值时将优势设为零,在新的环境中被发现过于激进,有效地阻断了 96% 的学习信号,并阻止了模型进行优化。

💬 Key Quotes

同样的模型,同样的奖励,同样的 600 个步骤。保留分数从 DAPO 的 -0.47,上升到 CISPO 的 -0.02,再到 CISPO + REPO-R 的 +1.33,最后在较小、过滤后的提示集上达到 +1.80。

📊 Article Meta

AI Screening: 90

Source: DEV Community: machinelearning

Author: Aleksei Romanov

Category: 人工智能

Language: 英文

Read Time: 10 min

Word Count: 2495

Tags:

AI 与智能应用 , 强化学习 , 大语言模型 (LLM) , 模型训练与推理 , 学习方法

#AI 与智能应用# 强化学习# 大语言模型 (LLM)# 模型训练与推理# 学习方法

文章评论(1)

青柠微凉4 分钟前

刚好最近在找这方面的资料,太及时了。

回复