1. π0.5模型架构深度解析
π0.5模型的核心创新在于构建了一个统一的多模态Transformer架构,能够同时处理高层语义推理和底层动作控制。这个架构由两个关键模块组成:26亿参数的视觉语言模型(VLM)主干和3亿参数的动作专家模块。
1.1 视觉语言模型(VLM)主干
VLM基于PaliGemma架构,主要负责多模态特征提取和高级语义理解。其输入处理流程如下:
- 图像处理:通过SigLIP视觉编码器将4个摄像头(前、后、双腕)的RGB图像切分为Patch并转换为视觉Token
- 状态编码:将机械臂的18-19个自由度关节角度和底盘速度离散化为文本Token
- 指令理解:用户提供的自然语言指令(如"清理厨房")通过文本Embedding转换为Token
这些多模态Token经过双向注意力机制融合后,输出高维语义特征。值得注意的是,VLM在预训练和后训练阶段承担着不同的角色:
预训练阶段:VLM需要预测包括FAST动作Token在内的多种输出目标。此时模型采用标准的自回归Transformer架构,通过next-token prediction学习多模态关联。
后训练阶段:VLM专注于高层语义推理,输出纯文本形式的子任务预测(如"拿起海绵")。此时的动作生成完全交由专门的动作专家模块处理。
1.2 动作专家模块
动作专家是一个轻量级Transformer,专门负责连续动作的生成。其核心技术特点是:
- 输入处理:接收加噪后的连续动作轨迹矩阵(形状为50×14,代表1秒内的50步动作)
- 时间步编码:通过正弦位置编码和双层MLP将噪声比例τ转化为时间特征
- 注意力机制:采用自适应RMSNorm将时间特征动态注入到每个Transformer层
动作专家与VLM的关键交互方式是单向注意力 - 动作专家可以关注VLM提取的特征,但VLM不会反向关注动作特征,这种设计防止了信息泄露和表征坍塌。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 两阶段训练机制详解
π0.5采用独特的两阶段训练策略,使模型能够先建立广泛的多模态关联,再专注于精确的物理控制。
2.1 预训练阶段
预训练阶段使用六种异构数据源:
- 网络多模态数据(WD):图像描述、VQA等
- 高层子任务数据(
