1. 项目概述
BFS-PO(Best-First Search for Large Reasoning Models)是一种针对大型推理模型的强化学习训练方法。它通过改进传统强化学习中的探索策略,让模型在训练过程中能够更高效地找到既准确又简洁的推理路径。
在传统强化学习框架下,模型通过多次独立采样来探索不同的推理路径,这种方式效率低下且难以保证结果的最优性。BFS-PO借鉴了广度优先搜索(BFS)的思想,将训练过程组织成一棵搜索树,通过系统地探索"岔路口"来寻找更优的解决方案。
关键创新点在于:不是简单地鼓励模型输出更短的答案,而是教会模型在正确的推理路径上,识别哪些步骤是真正必要的,哪些是可以简化的。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心原理与技术解析
2.1 传统方法的局限性
在深入理解BFS-PO之前,我们需要先了解现有方法存在的问题:
-
监督微调(SFT)的缺陷:
- 通过提供标准答案让模型模仿,容易导致过拟合
- 模型只学会复制特定解答模式,缺乏真正的推理能力
- 无法自适应处理题目变体或类似但不同的题目
-
简单长度惩罚的问题:
- 仅惩罚总输出长度,无法区分关键推理步骤和冗余内容
- 模型可能选择"偷懒"而非真正优化推理过程
- 缺乏细粒度的奖励信号指导模型改进
-
独立采样的低效性:
- 每次采样都是从头开始的独立尝试
- 无法有效利用之前采样中获得的信息
- 探索缺乏方向性,依赖大量采样才能找到较优解
2.2 BFS-PO的核心思想
BFS-PO的核心创新是将强化学习中的探索过程组织成一棵搜索树,通过系统性地探索"岔路口"来寻找更优的解决方案。具体来说:
-
搜索树结构:
- 根节点:输入问题
- 内部节点:部分生成的推理前缀
- 叶子节点:完整的推理过程和最终答案
- 边:从一个前缀到下一个前缀的生成步骤
-
搜索策略:
- 先找到一条正确的推理路径
- 回溯到路径上最不确定的决策点(高熵位置)
- 在该点尝试不同的选择,寻找可能更短的路径
- 重复这个过程,逐步优化推理路径
-
优势计算:
- 不再在全局所有采样间比较
- 而是在同一决策点的不同选择间比较
- 这使得奖励信号更加精确和有针对性
2.3 关键技术实现
2.3.1 熵引导的回退点选择
模型在生成每个token时都会产生一个概率分布,这个分布的熵值反映了模型在该决策点的不确定性:
code复制熵计算公式:
H(p) = -Σ p(x) log p(x)
选择回退点的策略:
- 计算当前最优路径上每个生成步骤的熵值
- 排除已经使用过的回退点(避免重复探索)
- 选择熵值最高的位置作为新的探索起点
这种策略的合理性
