1. 论文核心概述
这篇论文介绍了一个名为"AgiBot World Colosseo"的开源大规模操纵平台,旨在推动具身智能(Embodied Intelligence)领域的发展。平台的核心价值在于提供了一个包含100台多功能人形机器人的真实物理环境,采集了超过100万条操作轨迹、涵盖3000多种物体和217个不同任务的高质量数据集。
特别值得注意的是,这个平台的数据采集采用了远程操作(Teleoperation)方式,由熟练的操作员通过VR控制器或动作捕捉系统控制机器人完成各种精细操作任务。这种数据采集方式能够模拟人类操作的真实性和复杂性,为训练智能体提供了宝贵的学习素材。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 平台架构与技术细节
2.1 系统整体设计
AgiBot World Colosseo平台采用了边云协同的架构设计。在边缘端,部署了100台AgiBot G1机器人,每台都配备了:
- 高精度RGBD摄像头
- 视觉触觉传感器
- 双臂灵巧机械手
- 移动底盘
云端则负责:
- 数据存储与管理
- 模型训练
- 远程操作接口
- 质量评估系统
这种架构设计既保证了数据采集的实时性和多样性,又能充分利用云端强大的计算资源进行模型训练。
2.2 数据采集流程
数据采集过程经过了精心设计,确保数据的高质量和多样性:
- 任务设计:团队设计了217个涵盖不同场景的任务,包括物流、清洁、餐饮服务等
- 操作员培训:对远程操作员进行系统培训,确保操作的一致性和高质量
- 数据采集:操作员通过VR设备控制机器人完成任务
- 质量评估:每条采集的轨迹都经过人工评审
- 数据标注:对失败案例进行特别标注,记录失败原因和时间戳
这种严格的数据采集流程确保了数据集的可靠性和实用性。
3. 核心算法:ViLLA架构
3.1 三阶段训练框架
论文提出的ViLLA(Vision-Language-Latent-Action)架构包含三个关键阶段:
3.1.1 阶段一:潜在动作模型训练
- 使用InternVL2.5-2B作为视觉语言模型骨干
- 将连续图像序列映射到潜在动作空间
- 训练编码器-解码器结构,建立视觉输入到动作的中间表示
3.1.2 阶段二:潜在规划器训练
- 利用阶段一生成的潜在动作作为伪标签
