1. 项目概述
Molmo2是一个开源的多模态视觉语言模型(Vision-Language Model, VLM),其核心创新点在于针对视频理解和像素级接地(Grounding)任务进行了专门优化。与传统的VLM不同,Molmo2不仅能够处理单张图像输入,还能高效处理多图像序列和长视频输入,同时实现时空定位和跨模态语义对齐。
这个项目的最大价值在于它完全开源了训练数据和训练配方,使得研究人员和开发者能够基于此构建自己的VLM模型。在当前多模态AI快速发展的背景下,Molmo2为那些希望深入理解VLM训练过程,或者需要定制化视觉语言能力的团队提供了一个绝佳的起点。
提示:像素级接地(Grounding)指的是模型能够将语言描述与图像/视频中的具体像素区域关联起来的能力,这是实现细粒度视觉理解的关键技术。
2. 模型架构设计
2.1 基础架构组成
Molmo2采用了经典的VLM架构,由三个主要组件构成:
-
视觉编码器(ViT):负责将图像/视频帧转换为视觉特征。与常规做法不同的是,Molmo2没有使用ViT最后一层的输出,而是创新性地选择了倒数第三层(9th-from-last)和倒数第九层(3rd-from-last)的特征。这种设计继承自前代Molmo模型,实践表明中间层的特征对于细粒度视觉任务更为有效。
-
连接器(Connector):作为视觉和语言模态之间的桥梁,将视觉特征映射到语言模型的空间。连接器的设计直接影响跨模态对齐的效果。
-
大型语言模型(LLM):负责处理文本输入和生成输出。Molmo2使用了经过优化的LLM来处理与视觉内容相关的语言任务。
2.2 视觉输入处理策略
视觉输入处理面临两大核心挑战:高分辨率细节保留和长视频计算成本控制。Molmo2针对这些问题设计了专门的解决方案。
2.2.1 图像裁剪策略
为了在保持计算效率的同时不丢失图像细节,Molmo2采用了"单裁剪+多重叠裁剪"的组合策略:
-
基础裁剪:将图像下采样生成一个基础裁剪块(默认尺寸384×384),这与ViT的标准输入尺寸匹配。
-
重叠裁剪:额外生成K个重叠裁剪块平铺整个图像。训练时K=8,推理时K=24。这种设计确保能够覆盖图像边缘和细节区域。
-
尺寸适配逻辑:当图像尺寸无法被K个裁剪块整除时,先下采样至可平铺尺寸,避免使用黑边填充导致的特征噪声。
这种多裁剪策略使模型能够捕捉图像中的局部细粒度特征,特别是对小物体、文本等细节的识别至关重要,为后续的指向(Pointing)、计数等定位任务提供了像素级支持。
2.2.2 视频处理方案
视频处理的核心挑战是如何平衡时间覆盖范围和计算量。Molmo2的解决方案包括:
-
帧率采样:采用2FPS(帧/秒)的采样率,远低于原始视频帧率(通常30FPS),大幅减少需要处理的帧数。
-
帧数量限制:
- 常规训练设置最大帧数F=128
- 长上下文训练设置F=384
- 当视频时长超过F/S时(如128帧/2FPS=64秒),采用均匀采样确保覆盖全时段
- 强制保留最后一帧,因为用户交互常涉及视频结尾内容
-
时间戳对齐:采样帧的时间戳基于视频实际时长计算,而非简单的帧索引,确保时间维度的准确性。
3. 训练数据详解
3.1 数据集组成
Molmo2开源了九个新的数据集,覆盖了多种视觉语言任务:
- 稠密视频字幕(Dense Video Captioning):为视频中的每个重要片段生成详细描述。
- 长篇及长视频问答:针对复杂视频内容的多轮问答。
- 开放词表指代与跟踪:在图像、多图像和视频上的对象指代和跟踪任务。
这些数据集共同构成了一个全面的多模态训练资源,特别强调视频理解和细粒度视觉语言对齐能力。
3.2 数据分布与采样策略
训练数据的分布对模型性能有决定性影响。Molmo2采用了精心设计的采样策略:
- 类别平衡:确保不同任务类型的数据得到合理代表。
- 难度渐进:从简单图像任务开始,逐步引入复杂视频内容。
- 质量过滤:去除低质量标注和噪声数据。

上图展示了各类别数据在SFT混合数据集中的比例关系,这种分布设计确保了模型能够均衡发展各项能力。
4. 训练配方解析
4.1 三阶段训练流程
Molmo2采用递进式的三阶段训练策略,每个阶段有明确的目标和重点:
4.1.1 阶段1:轻量级图像预训练
这一阶段主要目标是建立基础的视觉-语言对齐能力:
-
数据组成:
- 60% PixMo-Cap(稠密图像字幕):学习视觉到文本的基本映射
- 30% 指向类数据(PixMo-Points, PixMo-Count, CoSyn-Point):培养像素级定位能力
- 10% NLP数据(Tulu SFT数据):保持语言能力不退化
-
训练重点:
- 视觉特征提取质量
- 基本的跨模态对齐
- 简单的定位能力
4.1.2 阶段2:监督微调(SFT)
这是模型能力扩展的核心阶段,整合了图像、视频和多图像数据:
-
新增能力:
- 视频时序理解
- 跨模态问答
- 视频指向和跟踪
- 多图像关联分析
-
关键技术:
- 注意力掩码优化
- 任务特定适配器
- 渐进式序列长度扩展
4.1.3 阶段3:长上下文微调
专门针对长视频理解进行的优化:
- 序列长度:从16k提升至36,864
- 视频帧数:从128增至384(2FPS下覆盖192秒视频)
- 关键技术:
- 高效注意力机制
- 长序列优化技巧
- 记忆压缩技术
4.2 关键技术细节
4.2.1 注意力掩码设计
Molmo2的注意力掩码设计是其高效训练的关键:
- 跨示例掩码:防止不同训练样本间的视觉Token/文本产生注意力交互,避免无关信息干扰。
- 跨任务掩码:同一样本的不同标注任务(如字幕生成和指向)之间不互相关注,防止任务间梯度冲突。

上图展示了一个包含两个样本的packed序列的注意力掩码结构,其中深粉色区域表示允许的注意力流动,空白区域表示被屏蔽的注意力。
4.2.2 训练参数配置
各阶段的训练参数经过精心调优:

关键参数包括:
- 学习率及调度策略
- 批量大小
- 序列长度
- 训练步数
- 优化器选择
5. 性能评估与实验结果
5.1 基准测试结果
Molmo2在多个标准测试集上展现了卓越性能:
- 视频指向任务:F1分数达到38.4,显著超过Gemini 3 Pro的20.0
- 图像字幕生成:在准确性和流畅度上达到SOTA水平
- 视频问答:长视频理解能力突出

5.2 消融研究
通过系统的消融实验验证了各组件的重要性:
- 多裁剪策略的影响:相比单裁剪,性能提升约15%
- 分层特征选择:使用中间层特征比最后一层特征效果更好
- 三阶段训练的必要性:跳过任一阶段都会导致性能下降
6. 实际应用与部署建议
6.1 应用场景
Molmo2适用于多种视觉语言任务:
- 智能视频分析:自动生成视频摘要,识别关键事件
- 交互式视觉搜索:通过自然语言查询定位视频中的特定内容
- 辅助创作工具:根据草图或部分内容生成完整描述
- 教育领域:自动解析教学视频内容,生成互动问答
6.2 部署优化建议
-
计算资源考量:
- 视频处理需要较高显存,建议使用至少24GB显存的GPU
- 长视频处理可考虑分段策略
-
推理加速技巧:
- 使用量化技术减少模型大小
- 采用缓存机制避免重复计算
- 对非实时应用可使用批处理提高吞吐量
-
定制化调整:
- 根据具体任务调整裁剪策略
- 针对垂直领域进行额外微调
- 优化提示工程提升特定任务表现
7. 常见问题与解决方案
7.1 训练相关问题
-
显存不足:
- 减少批次大小
- 使用梯度累积
- 尝试混合精度训练
-
收敛困难:
- 检查学习率设置
- 验证数据预处理是否正确
- 尝试warmup策略
7.2 推理相关问题
-
视频处理速度慢:
- 调整帧采样率
- 使用更小的裁剪尺寸
- 启用TensorRT加速
-
定位精度不足:
- 增加推理时的重叠裁剪数
- 后处理优化
- 针对特定场景微调
8. 未来扩展方向
基于Molmo2的开源特性,可以考虑以下扩展方向:
- 多语言支持:增加非英语语言能力
- 领域适配:针对医疗、工业等专业领域优化
- 交互式学习:引入人类反馈强化学习
- 效率优化:探索更高效的架构和训练方法
Molmo2的开源为视觉语言模型的研究和应用提供了坚实基础,其模块化设计也便于各种定制化扩展。通过理解其核心设计理念和技术细节,开发者可以更有效地利用这一资源,构建适合自己需求的视觉语言系统。
