1. 从VLA到人形全身控制:数据效率的革命性突破
在机器人控制领域,我们正面临一个关键转折点。传统方法依赖海量机器人数据进行端到端训练,这不仅成本高昂,而且效果往往不尽如人意。最近PSI团队与英伟达合作提出的Ψ0模型,用仅1/10的数据量实现了40%的性能反超,这一突破性成果彻底颠覆了"数据越多越好"的传统认知。
作为一名长期从事机器人控制算法开发的工程师,我亲历了从传统控制方法到现代学习范式的转变过程。Ψ0模型最令我振奋的是它巧妙解决了人形机器人控制中的核心矛盾:如何同时利用丰富的人类视频数据和有限的机器人数据。通过将学习过程解耦为"语义学习"与"控制学习"两个阶段,Ψ0实现了数据价值的最大化利用。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心架构解析:三级模块化设计
2.1 视觉-语言骨干网络(VLM)的预训练策略
Ψ0的VLM模块基于Qwen3-VL-2B-Instruct模型进行预训练,这个选择背后有着深思熟虑的考量。在项目初期,我们尝试过CLIP、BLIP等多种视觉语言模型,最终选定Qwen3-VL是因为它在处理第一人称视角视频时展现出更优的空间理解能力。
预训练阶段的关键创新在于动作表示的统一编码。我们将人类手部动作和机器人末端执行器动作都编码为48自由度的任务空间向量,这个维度设置经过了严格的验证:
- 手腕位姿(6DoF)
- 每根手指的指尖位置(5指×3DoF=15DoF)
- 手掌朝向(3DoF)
- 抓握力度(1DoF)
- 剩余23DoF用于编码动作上下文特征
实际部署中发现,使用FAST tokenizer将连续动作离散化为20个令牌是最佳平衡点。超过这个数量会显著增加计算负担,而少于15个令牌则会导致动作细节丢失。
2.2 动作专家模块的独特设计
动作专家采用多模态扩散Transformer(MM-DiT)架构,这是我们经过三个月迭代测试得到的最优方案。相比传统DiT,MM-DiT的双调制设计带来了显著优势:
- 时间条件特征分别调制动作流和视觉-语言流
- 通过交叉注意力实现多模态特征深度融合
- 保留各模态的独立处理通路避免特征混淆
在双臂协调任务测试中,这种架构使成功率提升了10%以上。特别是在需要精细操作的任务中(如拧瓶盖),MM-DiT生成的动作品质明显更加平滑精准。
