1. 项目概述
DoorMan是一个基于视觉的人形机器人行走-操作一体化学习框架,专注于解决开门这一极具挑战性的真实场景任务。这个项目由NVIDIA、UC Berkeley、CMU和CUHK的研究团队共同开发,其核心创新在于提出了一种教师-学生-自举的三阶段训练方法,实现了仅依赖RGB视觉输入的sim-to-real(仿真到现实)迁移。
开门看似简单,但对人形机器人来说却是一个极其复杂的任务。它需要:
- 通过运动的自我视角摄像头识别抓取位置
- 精确控制手部旋转带弹簧的门把手
- 跟踪门板的圆周运动轨迹
- 在合页施加的反作用力下保持全身平衡
这些高度耦合的要求使开门成为对任何通用行走-操作系统的强力测试。DoorMan的创新之处在于,它完全在仿真环境中训练,却能直接迁移到现实世界中的多种门类型上工作,且性能优于人类远程操作员。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术解析
2.1 教师-学生-自举学习框架
DoorMan采用三阶段训练流程:
2.1.1 教师策略训练
教师策略可以访问特权信息(如门的精确位姿、接触力等),使用PPO算法在仿真环境中训练。关键创新点包括:
- 分阶段奖励设计:将开门任务分解为接近、抓握、旋转、推开等子阶段,每个阶段有专门的奖励函数
- 分阶段重置策略:当环境进入新阶段时,保存当前状态快照;重置时有一定概率从中途阶段开始,而非总是从初始状态开始
这种设计显著提高了长时程任务的训练效率。例如,在传统方法中,机器人可能需要数百次尝试才能偶然完成一次完整的开门动作。而分阶段重置使得后期阶段的训练数据也能充分获取。
2.1.2 学生策略蒸馏
学生策略只能获取RGB视觉输入和本体感知信息(关节角度、速度等)。通过DAgger算法,将教师策略的知识蒸馏到学生策略中。关键技术点:
- 使用ResNet作为视觉编码器,提取图像特征
- 结合LSTM处理时序信息
- 本体感知信息与视觉特征融合后输入MLP生成动作
2.1.3 GRPO微调
为解决纯视觉策略的部分可观测性问题,使用Group Relative Policy Optimization(GRPO)对学生策略进行微调。这种方法:
- 不需要价值函数,直接从轨迹得分计算优势
- 鼓励策略学习补偿行为,如主动调整姿态保持操作目标在视野中
- 使用二元任务成功信号和简单正则项,避免复杂的奖励设计
2.2 大规模仿真随机化
为实现良好的sim-to-real迁移能力,DoorMan构建了高度多样化的仿真环境:
2.2.1 物理随机化
- 5种门类型(推门、拉门等)
- 门尺寸、把手位置、铰链阻尼随机变化
- 门闩机构的动力学特性随机化
2.2.2 视觉随机化
- 5233种穹顶光照纹理模拟不同环境
- PBR材质库随机应用于表面
- 相机参数扰动模拟真实机器人视角
这种大规模的随机化确保策略不会过拟合特定场景,而是学习通用的开门能力。
3. 实现细节与实操要点
3.1 硬件平台
DoorMan在Unitree G1人形机器人上实现,该机器人具有:
- 29个身体关节
- 14个手部关节
- 全身控制频率50Hz
- 头部搭载RGB摄像头
3.2 网络架构
学生策略的网络结构如下:
- 视觉编码器:ResNet-18,输出512维特征
- LSTM:2层,每层512单元,处理时序信息
- MLP:3层(512-256-128),输出目标关节角度
3.3 训练参数
- 教师训练:1000万步,128个环境并行
- 学生蒸馏:50万步演示数据
- GRPO微调:200万步
- 学习率:1e-4,使用Adam优化器
4. 性能评估与结果
DoorMan在多种测试场景中表现出色:
- 仿真测试:
- 在100种随机生成的门上测试
- 成功率98.7%
- 平均任务完成时间比人类遥操作快31.7%
- 现实迁移:
- 在5种真实门类型上测试(训练中未见过)
- 平均成功率89.2%
- 表现出良好的泛化能力
- 消融实验:
- 分阶段重置使训练效率提升3.2倍
- GRPO微调将现实成功率从72.5%提升到89.2%
5. 应用前景与扩展
DoorMan的技术路线可扩展到更多人形机器人任务:
- 递送物品:如给客户递水杯
- 家居操作:开关抽屉、使用家电等
- 工业场景:阀门操作、设备维护等
未来可探索的方向包括:
- 多任务联合学习
- 长期记忆与规划能力
- 人机协作接口
6. 实操经验与注意事项
在实际实现类似系统时,需注意以下要点:
- 仿真精度:
- 必须准确模拟接触动力学
- 门闩机构的弹簧效应需要精细建模
- 建议使用支持高精度接触仿真的引擎(如Isaac Lab)
- 训练技巧:
- 分阶段奖励需要精心设计
- 重置概率需要动态调整(早期侧重探索,后期侧重利用)
- 视觉编码器最好与策略联合训练
- 现实部署:
- 建议先进行相机-机器人标定
- 初始部署时使用安全绳保护机器人
- 准备紧急停止机制
- 计算资源:
- 教师训练需要大量GPU资源(建议至少4块A100)
- 学生蒸馏阶段需要存储大量演示数据(约1TB)
- 仿真环境并行度越高越好(至少64个并行环境)
7. 常见问题排查
在实际操作中可能遇到的问题及解决方案:
- 策略卡在某个阶段:
- 检查该阶段的奖励设计是否合理
- 增加分阶段重置的概率
- 添加针对该阶段的探索奖励
- sim-to-real性能下降:
- 增加视觉随机化强度
- 检查现实传感器校准
- 在更多样化的仿真环境中训练
- 机器人失去平衡:
- 在奖励函数中添加平衡项
- 检查全身控制器的参数
- 降低动作频率或幅度
- 抓取失败率高:
- 增加手部接触力的奖励
- 改进视觉注意力机制
- 添加抓取姿态的示范数据
DoorMan展示了基于学习的方法在复杂机器人任务中的强大潜力。通过精心设计的训练框架和大规模的仿真随机化,实现了仅依赖视觉的鲁棒开门能力。这套方法不仅适用于开门任务,也为更广泛的人形机器人应用提供了宝贵的技术路线。
