1. Fast-WAM:世界动作模型的训练与推理解耦新范式
在机器人控制领域,世界动作模型(World Action Models, WAMs)正成为连接感知与行动的关键桥梁。传统WAMs普遍遵循"先想象后执行"的范式——在推理时先生成未来视频预测,再基于预测结果生成动作。这种设计虽然直观,但带来了显著的推理延迟。清华与星海图的研究团队提出的Fast-WAM,通过解耦训练阶段的视频建模与推理阶段的未来生成,为我们揭示了WAM性能提升的真正来源。
1.1 传统WAM的瓶颈与突破
当前主流WAMs主要分为两类架构:
- 联合生成型:通过共享注意力机制同时去噪未来视频和动作(如Motus、Unified World Models)
- 因果推理型:严格遵循"先生成视频,再预测动作"的串行流程(如Vidar、Causal World Modeling)
这两种架构都将两个关键因素耦合在一起:
- 训练阶段的视频预测目标(学习物理先验)
- 推理阶段的显式未来生成(提供前瞻信息)
这种耦合导致了一个根本性问题:我们无法确定WAM的性能优势究竟来自训练时的表征学习,还是推理时的未来想象。更严重的是,迭代式的视频去噪过程使得推理延迟居高不下——即使在NVIDIA GB200上,DreamZero也只能达到7Hz的推理速度。
1.2 Fast-WAM的核心创新
Fast-WAM的创新在于架构层面的解耦设计:
训练阶段:
- 保留视频联合训练(video co-training)
- 通过结构化注意力掩码阻断动作token对未来视频token的访问
- 强制模型将物理理解压缩到潜在世界表征中
推理阶段:
- 完全移除未来视频生成分支
- 仅通过单次前向传播提取世界表征
- 基于KV Cache机制实现高效动作预测
这种设计带来了显著的效率提升——在RTX5090D V2上实现190ms的极速推理,比传统WAM快3-4倍。
1.3 关键发现与启示
通过构建三种受控变体(Fast-WAM、Fast-WAM-Joint、Fast-WAM-IDM),研究团队得出以下重要结论:
-
视频预测的主要价值体现在训练阶段:去除视频共训练会导致性能大幅下降(平均成功率降低23%),而仅去除推理时的未来生成则影响较小(仅降低7%)
-
世界表征的质量决定动作性能:训练时的视频预测目标促使模型学习到更丰富的物理先验,这些知识被编码在潜在世界表征中,成为动作生成的基础
-
推理效率与性能可以兼得:Fast-WAM在保持竞争力的同时,将推理速度提升至传统方法的3倍以上
这些发现为WAM的设计提供了新思路——我们可以通过强化训练阶段的世界建模,同时优化推理效率,实现"鱼与熊掌兼得"。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Fast-WAM架构深度解析
2.1 整体架构设计
Fast-WAM建立在Wan2.2-5B视频Diffusion Transformer(DiT)基础上,采用混合专家(Mixture-of-Transformer, MoT)架构:
mermaid复制graph TD
A[输入帧f0] --> B[Video DiT (5B)]
A --> C[Action DiT (1B)]
B --> D[潜在世界表征]
D --> C
C --> E[动作预测]
关键组件说明:
- Video DiT:5B参数的世界模型主干,负责从当前帧提取潜在世界表征
- Action DiT:1B参数的轻量级动作专家,专精于动作序列生成
- 结构化注意力掩码:控制不同token组间的信息流
2.2 训练阶段的精妙设计
2.2.1 三组token的协作与隔离
Fast-WAM在训练时处理三类token:
- 干净首帧token(f0):当前观测的潜在表示
- 带噪视频token(f1...fh):未来帧的噪声潜在表示
- 动作token(a1...ah):待预测的动作序列
通过精心设计的注意力掩码实现:
- 视频token可以关注f0和彼此(双向注意力)
- 动作token可以关注f0和彼此,但禁止关注视频token
- f0保持独立,不关注任何其他token
这种设计确保了:
- 视频预测建立在真实观测基础上
- 动作生成无法"偷看"未来信息
- 两个任务共享同一视觉上下文
2.2.2 训练目标函数
模型通过流匹配(Flow Matching)目标进行训练:
$$\mathcal{L} = \mathcal{L}{act} + \lambda\mathcal{L}$$
其中:
- $\mathcal{L}_{act}$:动作预测损失
- $\mathcal{L}_{vid}$:视频预测损失
- $\lambda$:平衡超参数(实验中设为1.0)
具体实现采用logit-normal噪声调度,在时间步t∈(0,1)上对目标变量y(动作或视频)添加噪声:
$$y_t = (1-t)y + t\epsilon, \quad \epsilon\sim\mathcal{N}(0,I)$$
模型需要预测去噪方向:
$$\mathcal{L}{FM} = \mathbb{E}||f\theta(y_t,t,o,l) - (\epsilon-y)||_2^2$$
2.3 推理阶段的高效实现
Fast-WAM的推理流程可分为两个阶段:
阶段一:世界表征提取
- 输入当前帧通过VAE编码得到f0
- f0经过Video DiT单次前向传播
- 输出特征存入KV Cache
技术细节:KV Cache机制允许在动作生成时重复利用已计算的特征,避免重复前向传播。视频主干的输出被转换为Key-Value对并缓存,供动作专家多次访问。
阶段二:动作序列生成
- Action DiT从KV Cache读取世界表征
- 进行10步轻量级去噪(相比视频生成的50+步大幅减少)
- 输出32步的动作序列块
这种"大小脑分工"的设计——大模型(Video DiT)负责理解世界,小模型(Action DiT)专精动作生成——是实现高效推理的关键。
3. 实验分析与实证发现
3.1 受控变体对比实验
研究团队设计了三种变体进行对比:
| 变体名称 | 训练策略 | 推理策略 | 动作依赖未来视频 | 延迟(ms) |
|---|---|---|---|---|
| Fast-WAM | 视频+动作(掩码隔离) | 直接动作生成 | 否 | 190 |
| Fast-WAM-Joint | 视频动作联合训练 | 联合去噪视频和动作 | 是 | 580 |
| Fast-WAM-IDM | 先视频后动作 | 先视频去噪再动作生成 | 是 | 810 |
| Fast-WAM-NoVideo | 仅动作训练 | 直接动作生成 | 否 | 190 |
3.2 性能指标对比
在MetaWorld和RLBench基准测试上的表现:
| 指标 | Fast-WAM | Fast-WAM-Joint | Fast-WAM-IDM | Fast-WAM-NoVideo |
|---|---|---|---|---|
| 平均成功率(%) | 78.3 | 80.1 | 79.6 | 55.2 |
| 轨迹平滑度 | 0.87 | 0.85 | 0.86 | 0.72 |
| 物理合理性评分 | 4.2/5 | 4.3/5 | 4.3/5 | 3.1/5 |
关键发现:
- 视频共训练的必要性:去除视频目标(NoVideo变体)导致性能骤降23%,证实了视频预测对学习物理先验的关键作用
- 推理效率优势:Fast-WAM比Joint快3倍,比IDM快4.3倍,且性能差距不足2%
- 泛化能力:在未见任务上,Fast-WAM的泛化性能优于NoVideo变体31%
3.3 延迟分解分析
对推理时间的详细分解:
| 步骤 | Fast-WAM | Fast-WAM-Joint | Fast-WAM-IDM |
|---|---|---|---|
| 视频特征提取(ms) | 45 | - | 120 |
| 视频去噪(ms) | 0 | 380 | 480 |
| 动作去噪(ms) | 145 | 200 | 210 |
| 总延迟(ms) | 190 | 580 | 810 |
可以看出,Fast-WAM通过消除视频去噪步骤,实现了显著的加速。值得注意的是,由于共享相同的Action DiT,各变体的动作去噪时间相近,差异主要来自视频处理。
4. 技术启示与未来方向
4.1 对WAM设计的启示
- 训练重于推理:应更注重训练阶段的世界建模质量,而非拘泥于推理时的显式未来生成
- 表征学习是关键:好的世界表征应能压缩物理规律,支持直接动作生成
- 效率与性能平衡:通过架构解耦可以实现"两全其美"
4.2 潜在改进方向
- 多模态表征学习:引入触觉、力觉等多模态信号强化世界表征
- 分层预测机制:对关键帧而非所有帧进行预测,进一步提升效率
- 在线适应能力:使模型能够根据实时交互调整世界模型
4.3 实际部署建议
对于考虑部署WAM的实践者:
- 数据收集:确保训练数据包含丰富的物理交互场景
- 架构选择:根据延迟要求权衡是否保留推理时的视频生成
- 监控指标:除任务成功率外,还需关注动作的物理合理性和安全性
Fast-WAM的提出不仅是一种架构创新,更改变了我们对世界模型价值来源的认知——世界模型的力量不在于它能生成多么逼真的未来画面,而在于它通过视频预测学习到的物理直觉和世界规律。这种认知转变,或许将引领下一代具身智能系统的发展方向。
