1. 为什么PPO成为大模型微调的首选算法?
在探索如何让大语言模型更好地理解人类意图时,研究人员尝试过多种强化学习算法。PPO(Proximal Policy Optimization)之所以能从众多算法中脱颖而出,成为当前大模型微调的事实标准,主要基于以下几个关键优势:
1.1 训练稳定性:大模型微调的生命线
大语言模型的训练成本极其昂贵,单次训练动辄需要数十万计算小时。在这种背景下,训练过程的稳定性变得至关重要。传统策略梯度方法(如REINFORCE)存在一个致命缺陷:策略更新步长难以控制。
想象一下教小朋友骑自行车:
- 激进的教学方法(大更新步长):可能让孩子摔得很惨,甚至从此害怕骑车
- 过于保守的方法(小更新步长):学习效率低下,永远学不会
PPO通过引入剪切机制(Clipping),确保每次参数更新都在可控范围内。具体来说,它限制了新旧策略之间的差异,防止单次更新对模型行为造成剧烈改变。这种"温和渐进"的特性,使得PPO在大模型训练中展现出惊人的稳定性。
实际经验:在使用PPO微调7B参数模型时,未采用剪切机制的对照组在约500步后就出现了奖励崩溃(reward collapse),而PPO组能稳定训练上万步。
1.2 样本效率:降低昂贵的人类反馈成本
RLHF(基于人类反馈的强化学习)流程中最昂贵的环节就是获取人类偏好数据。PPO通过以下设计显著提高了样本利用率:
- 多轮次参数更新:传统方法每批数据只进行一次梯度更新,而PPO可以对同一批数据执行多次(通常4-8次)更新
- 优势估计修正:采用GAE(Generalized Advantage Estimation)更准确地评估每个动作的长期价值
- 价值函数共享:策略网络和价值网络通常共享底层参数,减少需要学习的参数量
下表对比了不同算法在相同人类标注数据量下的表现:
| 算法 | 平均奖励提升 | 训练稳定性 | 所需人类标注轮次 |
|---|---|---|---|
| REINFORCE | 1.2x | 低 | 5 |
| A2C | 1.5x | 中 | 4 |
| PPO | 2.3x | 高 | 3 |
