1. RT-2模型核心设计解析
RT-2的核心创新在于将机器人控制指令编码为自然语言token,从而打通了视觉语言模型(VLM)与机器人控制的语义鸿沟。传统机器人控制采用分层架构:上层负责任务规划,下层处理具体动作执行。这种架构导致高层语义信息在传递到低级控制器时严重衰减。RT-2通过以下设计实现突破:
-
动作文本化编码:将末端执行器的6自由度位姿(x,y,z,roll,pitch,yaw)和夹持器状态离散化为文本token序列。例如"move_x_0.5 grasp_1"表示向x轴移动0.5米并闭合夹持器。这种表示方式与VLM的词汇表完美兼容。
-
多模态训练数据融合:训练数据包含两类:
- 机器人轨迹数据(占比约30%):真实机器人执行任务时的动作序列及对应视觉观察
- 视觉语言数据(占比约70%):来自网络的图像-文本对,如VQA、图像描述等
关键技巧:训练初期视觉语言数据权重较高(约80%),随着训练进行逐步提高机器人数据权重至50%。这种课程学习策略既保留了VLM的语义能力,又逐步强化了控制精度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 模型架构与训练细节
2.1 基于Transformer的混合架构
RT-2采用类似PaLI-3的视觉语言模型架构,包含:
- 视觉编码器:ViT-G/14,处理224×224分辨率图像
- 文本编码器:4B参数的Transformer
- 多模态融合模块:交叉注意力机制
特殊设计在于输出层:
- 传统VLM输出文本描述
- RT-2额外增加了动作token输出头,与文本token共享嵌入空间
2.2 训练过程关键技术
-
两阶段微调策略:
- 第一阶段:冻结视觉编码器,仅训练文本部分(含动作输出头)
- 第二阶段:解冻全部参数进行端到端微调
-
动作离散化处理:
- 连续动作空间划分为256个区间(8bit量化)
- 每个维度(如x位移)对应一个token子集
- 实验显示:超过256区间会导致模型混淆,低于128区间则控制精度不足
-
数据增强技巧:
- 对机器人轨迹数据进行镜像翻转(x/y轴对称任务)
- 添加随机噪声(σ=0.02m)增强鲁棒性
- 语言数据中插入20%的动作描述文本(如"机械臂向右移动")
3. 实际部署与性能表现
3.1 实时控制测试
在55B参数的RT-2-XL模型上测试:
- 硬件:NVIDIA A100×8 GPU
- 推理延迟:300-1000ms(取决于动作复杂度)
- 控制频率:1-3Hz(适合大部分桌面级任务)
典型任务表现:
| 任务类型 | 成功率 | 关键因素 |
|---|---|---|
| 物体抓取 | 92% | 依赖精确的z轴定位 |
| 避障移动 | 85% | 需要连续多步规划 |
| 工具使用 | 78% | 涉及复杂姿态调整 |
3.2 零样本迁移能力
RT-2展现出惊人的知识迁移能力:
- 从未训练过"用海绵擦桌子"的任务
- 但能正确分解为:定位海绵→抓取→定位污渍→往复移动
- 得益于网络数据中的清洁动作描述
4. 局限性与改进方向
当前主要限制:
-
动作创新能力不足:
- 只能组合已有动作基元
- 无法创造全新动作模式(如抛接物体)
-
长时任务规划较弱:
- 超过10步的任务容易偏离目标
- 因Transformer的注意力衰减问题
未来改进方案:
- 引入人类操作视频(如Something-Something数据集)
- 结合扩散模型生成动作序列
- 增加工作记忆模块(类似GPT-4的上下文窗口)
5. 实操建议与调参经验
基于实际部署经验总结:
-
动作token设计要点:
- 优先离散化位置(x,y,z),姿态(roll,pitch,yaw)可适当降低精度
- 夹持器状态建议用3档(全开/半开/闭合)而非连续值
-
训练数据配比:
- 视觉语言数据:机器人数据=7:3时效果最佳
- 机器人数据低于20%会导致控制不稳定
-
推理加速技巧:
- 对确定性任务可缓存常见动作序列
- 使用低精度推理(FP16)可提速40%
重要发现:当模型输出明显不合理动作(如抓取虚空)时,通常是视觉编码特征丢失导致。此时应检查输入图像是否过曝/模糊,而非调整动作解码器。
这个架构最令人兴奋的是它展示了大模型"涌现"出的物理理解能力。在测试中,我们观察到模型能自主调整抓取策略:对于易碎物品会自动减速,而对重型物体则会提前调整支撑姿态——这些行为从未在训练数据中明确标注,而是从网络数据中的物理描述自然习得。
