1. WAM研究背景与核心问题
在机器人操作模型领域,World Action Model(WAM)正引发新一轮研究热潮。去年底至今,Motus、Cosmos Policy、Lingbot-VA、DreamZero等突破性工作相继涌现,这些模型在仿真基准测试和真实机器人实验中展现出惊人性能,甚至让学界开始重新思考:WAM是否比传统的视觉语言动作模型(VLA)更具潜力?
这些前沿工作虽然实现方式各异,但都遵循着相似的范式——Imagine-then-Execute。简单来说,就是在训练时将未来视频预测(future video prediction)和未来动作预测(future action prediction)联合建模;推理时则让动作预测基于对未来视频的"想象"来生成。这种范式看似合理,但作为长期从事机器人学习的实践者,我不禁产生一个根本性质疑:WAM真正强大的秘密,究竟来自训练时的视频监督信号,还是推理时的显式未来想象?
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. WAM能力来源的深度解析
2.1 视频预测的双重角色
通过拆解典型WAM的工作流程,我们发现视频预测实际上承担着两种截然不同的功能:
训练阶段:视频预测任务为模型提供了密集的监督信号。这些信号与未来动作和环境演化高度相关,能有效帮助视频模型(即WAM的主干网络)学习到更优质的表示。就像教孩子学骑车时,不断反馈"车把偏左了""速度太快了"这样的即时指导。
推理阶段:视频预测为动作生成提供引导。此时的视频预测相当于给动作专家(action expert)提供未来场景的"预览",动作专家则扮演着类似潜在逆动力学模型(latent IDM)的角色。这就像骑自行车时,先想象接下来会遇到的弯道,再调整动作。
2.2 关键猜想的提出
当前主流WAM都采用Imagine-then-Execute的推理方式,这容易让人产生"推理时的未来想象不可或缺"的错觉。但结合VLA预训练的经验,我们提出了颠覆性猜想:
训练时的视频监督(因素1)才是WAM成功的真正关键,而推理时的显式未来想象(因素2)可能并非必需。
这个猜想源于一个简单类比:在VLA预训练中,离散动作token的联合训练(cotrain)作为代理任务(proxy task),其主要价值在于为VLM主干提供更好的监督信号,而非用于实际推理。同理,WAM中的视频预测任务,可能也只是训练阶段的"脚手架"。
3. Fast-WAM验证方案设计
3.1 解耦实验的挑战
验证这个猜想面临方法论挑战:现有WAM在训练时已将视频和动作联合建模,若简单地在推理时移除视频预测,就像比较苹果和橘子——根本不公平。为此,我们设计了极简的Fast-WAM架构,其核心特点是:
- 采用Video DiT和Action DiT的混合专家(MoT)结构
- 训练时联合优化但通过attention mask确保动作token不看未来视频token
- 去掉自回归外壳统一超参数,聚焦核心机制验证
3.2 三种对比变体
基于这个灵活架构,我们实现了三种关键变体:
Fast-WAM-Joint(A变体):视频和动作联合去噪,模拟Motus和DreamZero的做法。就像建筑师边看蓝图边施工。
Fast-WAM-IDM(B变体):因果式去噪,先视频后动作,对应Lingbot-VA结构。类似先看完整个蓝图再开始施工。
Fast-WAM(C变体):我们的核心提案——训练保留视频预测,但推理时跳过。相当于施工时不再反复查看蓝图,而是依靠训练获得的"肌肉记忆"。
作为对照,我们还测试了去除训练时视频监督的Fast-WAM-no-cotrain版本,就像完全不给建筑师看蓝图就要求施工。
4. 实验结果与深度分析
4.1 仿真基准测试
在标准仿真环境中的对比结果令人振奋:
| 模型变体 | 成功率(%) | 相对延迟 |
|---|---|---|
| Fast-WAM-Joint | 82.3 | 1.0x |
| Fast-WAM-IDM | 81.7 | 1.2x |
| Fast-WAM (ours) | 82.1 | 0.6x |
| Fast-WAM-no-cotrain | 63.5 | 0.6x |
关键发现:
- 跳过test-time视频生成(Fast-WAM)几乎不影响性能,与完整版相当
- 去除训练时视频监督则性能骤降近20%
- 推理时视频与动作的交互方式(联合vs因果)影响微乎其微
4.2 真机验证
为排除仿真环境偏差,我们在真实机器人平台进行了补充实验:
- Fast-WAM在7类日常任务中平均成功率达79.4%,与Joint/IDM变体无显著差异
- 去除训练监督的no-cotrain版本性能降至58.2%
- 推理速度提升1.7倍(得益于跳过视频生成)
特别说明:为公平比较,所有对比模型均未使用预训练权重。即使如此,Fast-WAM仍展现出与当前最佳WAM相当的竞争力。
4.3 条件视频预测的意外发现
我们还尝试了条件视频预测变体——让视频预测以未来动作为条件。理论上这应该帮助模型学习更精确的前向动力学,但实际表现却略逊于无条件版本。经过多次复现和排查,我们认为可能原因在于:
- 条件版本过度强调前向动力学,牺牲了潜在动作的学习机会
- 无条件版本通过视频预测隐式学习了两者关联
- 这与人类学习经验类似:刻意练习单个技能有时反而不如综合训练效果好
5. 与现有工作的本质区别
常有读者问Fast-WAM与Video Prediction Policy(VPP)的区别。虽然推理表现相似,但二者存在根本差异:
训练范式:
- VPP:两阶段训练(先视频后冻结)
- Fast-WAM:端到端联合训练
核心问题:
- VPP:生成式vs编码式表示哪个更好
- 本文:解耦训练监督与推理机制
与Unified Video Action Model(UVA)的区别则在于:
- UVA侧重统一架构,我们专注机制解耦
- 实验规模相差数十倍(UVA用小模型,我们采用5B参数级)
6. 实践启示与未来方向
6.1 对WAM设计的启示
基于大量实验,我们总结出WAM设计的黄金法则:
- 训练监督优先:确保视频预测任务提供高质量、高密度的监督信号
- 推理效率优化:可安全跳过耗时的显式视频生成
- 架构简化:不必过度设计视频-动作交互机制
6.2 实际部署建议
在真实机器人部署时,我们推荐:
-
数据准备阶段:
- 确保视频数据覆盖目标场景的动态变化
- 动作数据需与视频精确对齐(时间同步误差<100ms)
-
训练技巧:
- 采用渐进式训练策略:先低分辨率后高分辨率
- 视频预测损失权重建议设为0.3-0.5(过高会挤占动作学习)
-
推理优化:
- 使用TensorRT等工具优化动作专家网络
- 对实时性要求高的场景可降至5fps视频输入
6.3 未来研究方向
虽然Fast-WAM在小规模实验中验证了猜想,但仍有多个开放问题值得探索:
- 规模扩展效应:当模型参数量增至百亿级时,结论是否依然成立?
- 多模态扩展:引入语言模态会如何影响两种因素的平衡?
- 长期任务:对需要分钟级规划的复杂任务,显式想象是否会变得重要?
我们计划在三个月内开源所有变体的实现代码(包括Joint/IDM/no-cotrain版本),促进透明比较。同时正在构建更大规模的基准测试套件,欢迎社区共同完善。
在机器人学习领域,我们太容易陷入"更大更强"的军备竞赛。这项研究提醒我们:有时退一步,先理解模型为何有效,反而能走得更远。正如一位资深工程师所说:"知道为什么work比知道它work更重要。"
