1. 大模型训练中的SFT与RL:本质差异解析
在大模型训练领域,监督微调(SFT)和强化学习(RL)是两种核心方法,它们的底层逻辑和适用场景存在根本性差异。理解这些差异对于选择正确的训练策略至关重要。
1.1 SFT:基于行为克隆的密度估计
SFT本质上是一种密度估计方法,数学上表现为极大似然估计(MLE)。从RL的角度看,它最接近"行为克隆"的概念——从固定分布中采样数据,并对这些数据做MLE。具体来说:
- 输入状态s(在NLP中通常是上文context)
- 输出动作a(在NLP中就是下一个token)
- 目标是最小化模型策略π(a|s)与数据分布π*(a|s)之间的KL散度
关键特点是:
- 只看动作(action),不看奖励(reward)
- 假设数据集中出现的动作就是绝对真理
- 无脑提高数据集中动作的概率
这种方法的优势在于实现简单、训练稳定,但局限性也很明显:它无法区分样本的优劣,只要是数据集里的动作就同等对待。
1.2 RL:基于策略改进的回报最大化
相比之下,RL(特别是PPO这类策略梯度算法)的核心是策略改进。其梯度更新公式中包含关键的回报项:
∇J(θ) = E[∇logπ(a|s) * A(s,a)]
其中A(s,a)是优势函数,代表该动作带来的累计回报。这意味着:
- 正回报的动作会被增强
- 负回报的动作会被抑制
- 模型能够探索数据分布之外的高价值区域
RL的这种"结果依赖性"机制使其能够超越原始数据的限制,发现人类标注者可能忽略的高价值解决方案。
1.3 核心差异对比
| 维度 | SFT | RL |
|---|---|---|
| 优化目标 | 拟合数据分布 | 最大化累计回报 |
| 数据使用 | 静态利用(重采样/过滤) | 动态策略改进 |
| 泛化能力 | 限于原始数据分布 | 可探索分布外区域 |
| 训练稳定性 | 高 | 需要精心调参 |
| 计算成本 | 相对低 | 通常较高 |
提示:在实际应用中,SFT通常作为RL训练的前置步骤,先确保模型掌握基本能力,再通过RL进行精细调整。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. SFT作为退化版Offline RL的条件分析
2.1 Offline RL的基本特点
Offline RL(离线
