1. 多模态奖励建模的现状与挑战
多模态大语言模型(MLLM)近年来取得了显著进展,其中人类偏好对齐技术发挥了关键作用。作为这一技术的核心组件,多模态奖励模型(MRM)承担着评估和引导模型输出的重要职责。然而,当前MRM的发展正面临一个根本性瓶颈:高质量多模态偏好数据的严重稀缺。
1.1 从判别式到生成式的范式转变
传统MRM主要采用判别式方法,将奖励建模视为一个分类或回归问题。这种方法虽然直观,但存在明显的局限性:
- 泛化能力受限:难以适应复杂、开放式的多模态任务
- 解释性不足:无法提供人类可理解的推理过程
- 任务适应性差:针对不同任务需要单独训练模型
近年来,随着思维链(CoT)技术的成熟,MRM研究出现了向生成式方法的范式转变。生成式MRM能够:
- 通过自然语言推理解释其判断依据
- 统一处理多种任务类型
- 更好地利用大语言模型的内部知识
1.2 强化学习带来的新机遇与挑战
基于可验证奖励的强化学习(RLVR)进一步提升了生成式MRM的性能。RLVR通过以下机制增强模型能力:
- 迭代优化:通过多轮反馈持续改进模型表现
- 细粒度调整:对模型各部分进行针对性优化
- 能力激发:发掘模型的潜在推理能力
然而,RLVR训练严重依赖人工标注的多模态偏好数据,这类数据存在三个主要问题:
- 标注成本高:需要专业标注人员处理复杂的多模态内容
- 规模受限:难以获得足够数量的高质量样本
- 领域覆盖窄:难以涵盖所有可能的任务场景
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. MSRL方法的核心设计
针对上述挑战,MSRL(多阶段强化学习)提出了一种创新的解决方案。其核心思想是通过分阶段训练,将文本数据上习得的推理能力迁移到多模态任务中。
2.1 整体架构设计
MSRL采用三阶段渐进式训练策略:
- 文本阶段:在大规模文本偏好数据上建立基础推理能力
- 描述阶段:通过文本描述桥接文本与多模态领域
- 多模态阶段:在真实多模态数据上进行最终微调
这种设计具有以下优势:
- 数据效率:最大化利用易获取的文本数据
- 能力迁移:分步解决模态差异问题
- 训练稳定性:避免直接处理复杂多模态带来的挑战
2.2 阶段1:文本强化学习
这一阶段专注于构建强大的文本推理能力,具体实现包含三个关键步骤:
- 监督微调(S
