1. VITRA模型:用人类视频预训练机器人操作的新范式
在机器人操作领域,获取高质量的训练数据一直是制约模型性能提升的瓶颈。传统方法需要大量精心设计的机器人演示数据,不仅成本高昂,而且覆盖的场景和任务类型有限。来自清华和微软亚洲研究院的研究团队提出了一种创新解决方案——VITRA模型,它能够利用互联网上大量存在的非结构化人类活动视频来预训练视觉-语言-动作(VLA)模型。
这项研究的核心突破在于发现:人类手部活动视频可以转化为机器人操作训练所需的VLA数据格式。通过将人手视为灵巧的机器人末端执行器,研究人员开发了一套完整的自动化流程,能够从原始视频中提取3D手部运动、分割原子级动作片段,并自动生成对应的语言指令。基于这一方法,他们构建了包含100万个片段、2600万帧的大规模手部VLA数据集,覆盖了烹饪、清洁、建造等丰富的现实生活场景。
关键创新:首次证明非结构化人类视频可以直接用于机器人操作模型的预训练,突破了传统机器人学习对标注数据的依赖。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术实现:从人类视频到机器人操作的完整流程
2.1 3D运动标注:重建手部与相机运动
VITRA框架的第一步是从原始视频中精确提取3D运动信息。这个过程面临几个关键挑战:
- 视频可能来自不同设备,相机参数未知
- 相机可能是静止或移动的
- 需要同时跟踪双手的精细运动
解决方案采用多阶段处理流程:
- 相机运动检测:基于背景光流分析判断相机是静止还是移动
- 相机标定:
- 运动相机:使用DroidCalib算法
- 静止相机:结合MoGe-2和DeepCalib方法
- 手部重建:采用HaWoR系统逐帧重建3D手部模型,输出包含:
- 腕部6D姿态(位置+旋转)
- 15个关节角度(基于MANO手部参数模型)
- 相机位姿跟踪:改进MegaSAM算法,替换其深度估计模块为MoGe-2
- 运动平滑处理:对世界坐标系下的手部运动进行样条平滑和异常值剔除
这一阶段的输出是精确的、度量尺度下的3D手部运动序列,可以转换到任意视频帧的相机坐标系中,为后续处理奠定基础。
2.2 原子动作分割:捕捉自然动作节拍
将长视频分割为符合机器人操作训练要求的原子级动作片段是第二个关键步骤。传统视频分割方法通常基于语义或时间窗口,但都不适合这里的特定需求。
VITRA的创新在于发现了人手运动的自然"节拍"现象——在动作转换时,手部速度会呈现明显的最小值。基于这一观察,设计了高效的分割算法:
- 计算世界坐标系下3D手腕的运动速度曲线
- 对速度曲线进行平滑处理(高斯滤波)
- 检测局部速度最小值点作为分割边界
- 为每只手独立分割,忽略另一只手的运动
这种方法完全基于运动学特征,无需任何预训练模型或文本标签,处理速度极快(约1000帧/秒),非常适合大规模应用。虽然可能导致某些连续动作(如擦拭)被过度分割,但这些片段可以在后续指令标注后重新合并。
2.3 指令标注:自动化生成动作描述
有了原子级动作片段后,下一步是为每个片段生成对应的语言指令。VITRA采用GPT-4.1进行自动化标注,但设计了特殊的输入格式来保证质量:
- 视觉提示增强:从片段中均匀采样8帧,叠加从当前帧到片段结束的手部运动轨迹投影
- 结构化提示:要求GPT以祈使句格式描述动作,例如"用右手拿起杯子"
- 质量过滤:对缺乏明确语义的动作标记为"N/A"并排除
实验表明,这种基于原子片段+轨迹可视化的方法比简单截取固定长度片段能显著提高标注准确率。这是因为叠加的运动轨迹为语言模型提供了明确的动作意图线索。
3. 数据集构建与模型设计
3.1 手部VLA数据集
利用上述流程,研究团队处理了来自Ego4D、Epic-Kitchen等数据集的视频,构建了目前最大的手部VLA数据集:
- 规模:100万片段,2600万帧
- 来源分布:
- Ego4D:77%
- Epic-Kitchen:12%
- EgoExo4D:6%
- SSV2:5%
- 场景覆盖:烹饪、清洁、建造、修理、工艺制作、绘画等
- 动作类型:抓取、放置、倾倒、擦拭等日常操作
与现有机器人数据集相比,该数据集在物体多样性、环境复杂度和任务类型上都有数量级的提升。例如,包含超过5000种不同物体,而典型机器人数据集通常只有几十种。
3.2 VLA模型架构
VITRA模型由视觉-语言模块(VLM)和动作生成模块组成:
VLM骨干网络:
- 基于PaliGemma-2架构
- 视觉编码器:SigLIP(冻结参数)
- 语言模型:Gemma-2(3B参数)
- 特殊设计:
- 添加相机视场角(FoV)作为额外token
- 引入可学习的"认知"token捕获任务理解
动作专家模块:
- 基于扩散Transformer(DiT)
- 输入:噪声动作块+认知特征+手部状态
- 输出:去噪后的动作序列
- 关键创新:
- 因果注意力机制:处理动作序列的时序依赖
- 动作掩码:处理单手/双手动作的灵活组合
动作空间定义:
对于每只手,动作表示为:
- Δt∈R³:相对平移
- Δr∈SO(3):相对旋转(转换为欧拉角)
- θ_h∈R¹⁵:关节角度变化
这种表示与大多数灵巧机器人手的控制接口兼容,便于后续迁移。
4. 训练策略与性能优化
4.1 预训练阶段
VITRA采用两阶段训练策略:
-
初始化阶段(5000步):
- 仅训练动作专家模块
- 学习率:1e-4
- 目标:建立基本的动作生成能力
-
联合训练阶段(80000步):
- 微调VLM骨干(除视觉编码器外)
- 同时优化动作专家
- 学习率:VLM 1e-5,动作专家 1e-4
- 批大小:512
数据增强策略:
- 轨迹感知的图像裁剪:确保手部轨迹始终在视野内
- 随机透视变换:模拟不同视角
- 颜色抖动:增强光照鲁棒性
- 水平翻转:增加镜像动作的多样性
这些增强手段显著提升了模型对未见场景的适应能力。
4.2 机器人微调
将预训练模型迁移到真实机器人需要解决两个关键问题:
-
动作空间映射:
- 将机器人关节映射到最接近的人手关节拓扑
- 未映射的关节保持固定或简单插值
-
训练策略:
- 使用少量(约1200条)真实机器人轨迹
- 批大小:256
- 学习率:1e-5
- 训练步数:20000
实验表明,这种迁移方式能有效保留预训练获得的一般操作技能,同时适应特定机器人平台的运动特性。
5. 实验验证与性能分析
5.1 人手动作预测评估
在未见过的真实场景中,VITRA展示了强大的零样本操作能力:
抓取任务:
- 评估指标:预测手指与目标物体的最小距离(d_hand-obj)
- 结果:相比基线方法降低32%误差
一般动作任务:
- 通过用户研究评估(23名参与者)
- 在117个新场景中,VITRA预测动作的合理性评分比次优方法高41%
5.2 机器人操作性能
在Realman机器人平台上测试了四项任务:
-
拾取放置:
- 见过物体:98%成功率
- 未见物体:89%成功率
- 未见类别:76%成功率
-
功能性抓取:
- 成功识别并抓取物体功能部位(如把手、壶嘴)
-
倾倒任务:
- 准确控制倾倒角度和持续时间
-
清扫任务:
- 完成清扫并回收工具的完整流程
与从头训练的模型相比,VITRA微调后的模型在少量数据下表现显著更好,特别是在泛化到新物体时优势明显。
6. 关键发现与实用启示
通过这项研究,我们得到几个重要启示:
-
数据效率的革命:
- 传统机器人学习需要大量特定任务数据
- VITRA证明人类视频可作为廉价、丰富的预训练资源
- 微调所需真实数据量减少10-100倍
-
动作表示的统一性:
- 人手与机器人手的运动学相似性被低估
- 简单的关节映射就能实现有效知识迁移
-
规模定律的适用性:
- 模型性能随预训练数据量持续提升
- 表明当前方法远未达到数据瓶颈
对于实际应用,建议:
- 收集多样化的人类操作视频作为基础数据
- 优先考虑操作场景的覆盖度而非特定任务的精度
- 在迁移到机器人时,保留预训练模型的视觉理解能力
这项研究开辟了机器人学习的新范式——通过利用海量人类活动视频来突破数据瓶颈。未来,随着视频数据的不断积累和模型架构的改进,我们有望看到机器人操作能力迎来类似大语言模型的飞跃式发展。
