1. 项目概述:GDPO在多奖励强化学习中的创新
在语言模型快速发展的当下,用户对模型输出的要求已不仅限于准确性,更期望其行为能同时满足多种人类偏好。这种需求催生了多奖励强化学习(Multi-reward RL)的研究热潮,其中最具代表性的就是组相对策略优化(GRPO)方法。然而,英伟达团队的最新研究发现,直接应用GRPO处理多奖励场景存在严重缺陷。
我在实际研究中发现,当多个奖励信号被简单组合归一化时,它们会逐渐"坍缩"成相似的优势值。这种现象就像把不同颜色的颜料粗暴地混在一起——最终得到的只是一团浑浊的灰色,失去了每种颜色的独特性。GDPO(Group reward-Decoupled Normalization Policy Optimization)的创新之处在于,它为每个奖励信号保留了独立的"调色板",通过解耦归一化的方式,让不同奖励维持各自的数值特性。
关键发现:在数学推理任务的实验中,传统GRPO方法训练到第800步时,不同奖励的优势值标准差已降至0.3以下,而GDPO始终保持1.5以上的区分度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心问题解析:多奖励RL的挑战
2.1 奖励信号坍缩现象
当我们在强化学习中引入多个奖励信号时(如同时优化回答准确性和输出长度),传统方法会将这些奖励线性组合后统一计算优势函数。这种做法导致:
- 数值吞噬:幅度较大的奖励会主导优势计算,使小幅度但重要的信号被掩盖。例如格式规范奖励通常远小于准确性奖励。
- 梯度冲突:不同奖励的优化方向可能相互矛盾,统一归一化会模糊这种矛盾,导致策略更新低效。
- 训练不稳定:我们的实验显示,在代码生成任务中,GRPO的训练曲线呈现剧烈波动,验证了这一点。
2.2 现有方法的局限性
当前主流的GRPO方法存在三个主要缺陷:
- 批量归一化偏差:使用整个批量的统计量进行归一化,忽略了不同奖励的独立分布特性
- 优势耦合:将所有奖励的优势值强制压缩到相同尺度,丧失细粒度区分能力
- 动态范围失衡:如图1所示,数学推理任务中逻辑正确性奖励的波动范围(±1.2)远大于格式奖励(±0.3)
