1. 视频生成器作为机器人策略的核心思想
哥伦比亚大学和TRI的研究团队提出了一种革命性的机器人控制方法:将视频生成器直接作为机器人策略。这种方法的核心在于,通过训练一个能够生成机器人行为视频的模型,然后仅需少量演示数据来训练一个解码器,将生成的视频映射到机器人可直接执行的动作。
1.1 传统视觉运动策略的局限性
当前视觉运动策略面临两大根本性挑战:
- 泛化能力不足:难以应对感知或行为分布变化的情况
- 数据依赖性高:性能受限于人类演示数据的规模
1.2 视频生成作为策略学习的代理
研究团队发现,视频生成模型本身就具备策略学习的潜力。只要视频生成模型能够合成准确的机器人行为视频,那么经过训练的解码器只需极少量的演示数据即可学习将视频映射到机器人动作。这表明:
- 视频生成模型本身就是策略
- 解码器主要充当接口,而非学习任务策略本身
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 视频策略(Video Policy)框架详解
2.1 整体架构设计
视频策略框架是一个结合视频和动作生成的模块化框架,可以进行端到端的训练。其核心组件包括:
- 视频生成器f:用于合成机器人展开视频
- 动作预测模型g:根据合成帧预测机器人动作a_t
2.2 去噪扩散架构
框架采用去噪扩散架构,包含:
- 视频U-Net网络μθ
- 动作U-Net网络αθ
基于稳定视频扩散(SVD)架构,通过交叉注意机制将视频U-Net模型μθ条件化为任务c的文本描述CLIP嵌入φ(c)。
2.3 动作预测机制
动作U-Netαθ的条件来自视频去噪网络的中间特征:
- 从视频U-Net的解码器层中提取五个等间距的隐层嵌入
- 这些时空特征通过CNN适配器转换为单向量hi
- 该向量作为全局条件输入到一维CNN U-Net模型αθ中
3. 训练与部署流程
3.1 两阶段训练方法
训练分为两个阶段:
- 训练视频模型进行视频预测
- 训练动作模型进行行为克隆
训练数据集为专家演示数据集D = {d1,...,dn},每个演示di包含:
- 场景视频观测
- 任务文本描述c
- 相应的机器人动作
3.2 训练目标
- 视频模型μθ的训练目标是最小化L_video
- 动作模型αθ的训练目标是最小化L_action
关键设计:阻止L_action的梯度反向传播到μθ,这显著提高了性能。
3.3 部署流程
- 提供初始视觉观测v0和任务描述c
- 模型联合生成预测视频帧序列{vˆt}和动作序列
- 预测动作{at}直接用于控制机器人末端执行器
4. 实现细节与技术要点
4.1 多视角视频输入
系统使用三个摄像头:
- 安装在机械臂上的摄像头
- 场景左侧摄像头
- 场景右侧摄像头
三个视角沿时间维度拼接,使得vt模型训练用于预测每个摄像头视角的8帧(总共24帧)。
4.2 训练参数设置
- 视频预测学习率:1e-5
- 动作预测学习率:5e-5
- 训练时长:约两周(8块A100 GPU)
- 推理去噪步骤:30步
- 无分类器引导(CFG)尺度:2.0
4.3 性能指标
在A100 GPU上:
- 生成25帧视频(256×256分辨率,30扩散步骤)约需9秒
- 在RoboCasa和Libero10基准测试上表现优异
5. 实验验证与结果分析
5.1 仿真实验设置
使用RoboCasa和Libero10仿真基准测试:
- RoboCasa:50个人类演示,256×256分辨率
- Libero10:调整为相同分辨率
动作空间定义为ai,包括:
- 机械臂的6自由度姿态
- 机械臂打开/关闭状态的标量值
5.2 基线模型比较
作为RoboCasa的基线模型:
- 统一视频动作(UVA)
- ImageNet预训练的ResNet和CLIP的扩散策略变型
5.3 实际应用设置
- 数据采集:人类演示者使用改装后的机器人夹爪执行任务
- 传感器配置:
- 侧视RGB摄像头:Intel RealSense D435
- 夹爪摄像头:Basler鱼眼摄像头
- 夹爪姿态跟踪:RealSense T265
- 颚张开度估计:ArUco标记跟踪
- 力传感器:测量抓取力
5.4 控制策略
- 预测32步的夹爪相对姿态、颚部相对位置和绝对抓取力
- 阻抗控制跟随预测的夹爪姿态和颚部位置
- 安全机制:当预测力比实测力大300克以上时,应用较小的夹爪闭合修正
6. 技术优势与创新点
6.1 显著优势
- 样本效率高:仅需少量演示数据即可提取策略
- 鲁棒性强:对未见过的物体、背景和任务具有强大泛化能力
- 性能优异:超越传统行为克隆(BC)方法
6.2 关键创新
- 视频生成模型作为策略骨干
- 无动作视频数据对任务泛化的关键作用
- 大规模视频生成模型的先验知识利用
7. 应用前景与潜在影响
7.1 应用场景
- 复杂环境下的机器人操作
- 小样本学习场景
- 需要高泛化能力的任务
7.2 潜在影响
- 降低机器人策略学习的数据需求
- 提高机器人对新任务的适应能力
- 推动视频生成与机器人控制的融合研究
8. 技术挑战与未来方向
8.1 当前挑战
- 计算资源需求高
- 实时性有待提升
- 复杂任务的长序列预测能力
8.2 未来方向
- 更高效的架构设计
- 多模态输入融合
- 长期记忆机制的引入
- 在线学习能力的增强
9. 实操经验与注意事项
9.1 训练技巧
- 视频模型预训练至关重要
- 梯度反向传播需要精心设计
- 学习率设置需要分阶段调整
9.2 部署要点
- 传感器同步是关键
- 预测动作需要平滑处理
- 安全机制必须完善
9.3 常见问题排查
- 视频预测质量差:
- 检查预训练模型适配性
- 调整学习率和训练步数
- 动作预测不准确:
- 检查特征提取层
- 验证动作空间定义
- 泛化能力不足:
- 增加无动作视频数据
- 调整模型容量
10. 结论与展望
这项研究开创性地将视频生成器作为机器人策略,通过实验验证了其有效性。该方法不仅解决了传统视觉运动策略的两大挑战,还展示了视频生成模型在机器人控制领域的巨大潜力。未来,随着视频生成技术的进步和计算资源的提升,这种方法有望成为机器人策略学习的主流范式之一。
