1. 大模型强化学习的训练-推理不匹配问题剖析
在大型语言模型(LLM)的强化学习(RL)训练过程中,训练-推理不匹配(Training-Inference Mismatch)已成为制约模型性能提升的关键瓶颈。这个问题的本质在于:模型在训练阶段和推理阶段的行为存在系统性差异,导致训练优化的目标与实际的推理表现不一致。
1.1 策略梯度框架下的根本矛盾
在标准的策略梯度方法中,我们优化的目标是:
$$
J(\theta) = \mathbb{E}{y\sim \mu} [r(y) \log \pi\theta(y)]
$$
这里存在一个根本性的矛盾:动作序列y是从行为策略μ中采样得到的,而梯度更新却是基于目标策略π的对数概率计算的。这种off-policy的设置本身就引入了偏差。
在实际的LLM RL训练中,这种矛盾被进一步放大:
- 推理阶段:通常使用高吞吐的推理引擎(如vLLM/sgLang)生成响应
- 训练阶段:参数更新发生在训练引擎(如FSDP/Megatron)中
即便使用相同的模型参数,由于以下因素会导致策略分布在token级别上出现不一致:
- 数值实现的差异(如不同的矩阵乘法实现)
- 计算精度的差异(训练常用FP32,推理可能用FP16/INT8)
- 算子级别的优化差异
1.2 MoE模型中的专家不一致问题
在混合专家(Mixture-of-Experts,MoE)模型中,问题更加复杂。MoE模型通过门控机制为每个token动态选择Top-k专家参与计算,这种设计带来了额外的挑战:
- 路由不一致:训练和推理阶段可能对同一输入选择不同的专家集合
- 策略陈旧性(Policy Staleness):在分布式训练中,全局批次被拆分为多个mini-batch进行多次更新,导致同一时间步的新旧策略可能激活不同专家
这种专家级别的差异会显著影响模型的行为,使得训练阶段优化的目标与推理阶段的实际表现产生偏离。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 训练稳定性的核心挑战与解决思路
2.1 序列奖励与token优化的矛盾
LLM RL中一个独特的挑战是奖励信号的粒度问题:
- 奖励通常是标量值,作用于整个响应序列(sequence-level)
- 但优化是在token级别进行的
理想的序
