1. DSDR框架:破解大模型推理中的探索坍缩难题
在大型语言模型的推理能力训练中,我们正面临一个日益突出的困境:模型会迅速锁定几种看似有效的推理模式,然后陷入"一条路走到黑"的僵局。这种现象在数学推理、代码生成等需要多步逻辑推导的任务中尤为明显。香港科技大学、卡内基梅隆大学和微软研究院联合提出的DSDR(Dual-Scale Diversity Regularization)框架,为解决这一难题提供了创新性的解决方案。
作为一名长期关注大模型推理能力提升的研究者,我亲历了从早期基于人类反馈的强化学习(RLHF)到如今基于可验证奖励的强化学习(RLVR)的范式转变。RLVR利用数学题答案可程序化验证的特性,摆脱了对人工标注的依赖,极大提升了训练效率。但随之而来的"探索坍缩"问题却成为制约模型性能进一步提升的瓶颈——模型会快速收敛到少数几种固定推理模式,丧失探索新解法的能力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 探索坍缩:RLVR训练中的隐形杀手
2.1 现象观察与问题定义
在实际训练中,探索坍缩表现为三个典型特征:
- 推理路径高度同质化:对同一问题生成多次推理过程,得到的解决方案在思路、步骤甚至措辞上都惊人地相似
- 解法单一化:面对本可多角度解决的问题,模型固执地使用同一种方法
- 训练高原效应:模型性能在达到一定水平后停滞不前,甚至出现倒退
这种现象的根源在于强化学习的固有特性。当模型发现某种推理模式能稳定获得奖励时,策略梯度会不断强化这条路径,导致其他可能性被快速抑制。传统的token级熵正则化只能带来表面的多样性——就像让作家用不同词汇讲述同一个故事,而无法真正改变叙事结构。
2.2 现有方法的局限性
当前主流的RLVR算法如GRPO和DAPO,虽然在训练效率和稳定性上取得了显著进步,但在处理探索坍缩问题上存在明显不足:
- GRPO(Group Relative Policy Optimization):通过组内相对比较替代价值函数,虽然降低了计算复杂度,但缺乏有效的探索激励机制
- DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization):改进了解耦剪辑和动态采样策略,但仍局限于token级别的多样性控制
这些方法的一个共同
