1. 小米Xiaomi-Robotics-0模型深度解析
在机器人技术快速发展的今天,如何让机器人更智能地理解和执行复杂任务一直是行业难题。小米最新开源的Xiaomi-Robotics-0模型给出了一个令人惊艳的解决方案——这是一个将视觉、语言理解和动作生成完美结合的视觉-语言-动作(VLA)模型。不同于传统机器人控制系统需要针对每个任务单独编程,这个47亿参数的强大模型可以直接理解自然语言指令,观察环境,并生成精确的动作序列。
我特别关注到它在实时性方面的突破:通过创新的异步执行机制和Λ形注意力掩码技术,模型在NVIDIA RTX 4090上实现了仅80ms的推理延迟。这意味着机器人可以流畅地连续执行动作而不会出现卡顿,这对于需要精细操作的场景(如拆卸乐高或折叠毛巾)至关重要。在LIBERO、CALVIN等标准测试中,它都刷新了性能记录,展示了强大的泛化能力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 模型架构与核心技术
2.1 双阶段混合架构设计
Xiaomi-Robotics-0采用了创新的"预训练视觉语言模型(VLM)+扩散Transformer(DiT)"双组件架构。这种设计既保留了大型语言模型强大的语义理解能力,又通过扩散模型实现了高精度的动作生成。
VLM部分基于Qwen3-VL-4B-Instruct模型,专门处理视觉和语言输入。在实际部署中,我发现它对机器人视角的图像有出色的理解能力——无论是腕戴摄像头拍摄的模糊画面,还是存在遮挡的场景。模型会将这些视觉信息与语言指令一起编码为KV缓存,作为动作生成的依据。
动作生成则由16层扩散Transformer完成。这里采用了流匹配(Flow Matching)技术而非传统扩散模型,使得动作预测更加稳定。特别值得注意的是,模型不是预测单个动作,而是生成包含T个时间步的动作块(通常T=10),这种批处理方式大幅提升了实时性能。
2.2 关键训练技术创新
2.2.1 预训练阶段的胜者全得机制
在预训练第一阶段,模型需要同时处理视觉语言数据和机器人轨迹数据。这里采用了一个巧妙的"多候选筛选"策略:
- 模型会并行预测N个可能的动作序列候选(论文中N=5)
- 计算每个候选与真实动作的L1距离作为评分
- 只对得分最高的候选进行梯度回传
这种机制有效解决了机器人动作的多模态问题——同一个任务可能存在多种合理的执行方式。我在复现时发现,相比传统单一预测,这种方法使模型收敛更快且动作更加自然。
2.2.2 流匹配与自适应归一化
第二阶段采用流匹配损失训练DiT部分,这是比传统扩散模型更高效的生成方式。这里有几个工程细节值得注意:
- 从Beta分布而非均匀分布采样时间步τ,给噪声较大的时间步更高权重
- 使用adaLN(自适应层归一化)将时间步条件注入DiT
- 添加可学习的"sink token"稳定注意力分布
实测表明,这种配置下模型只需5个流匹配步骤就能生成高质量动作,大幅降低了推理耗时。
3. 实时部署关键技术
3.1 异步执行架构
传统同步执行模式存在明显缺陷——机器人必须等待完整推理完成后才能执行动作,导致动作不连贯。Xiaomi-Robotics-0的异步执行方案完美解决了这个问题:
- 将动作块分为立即执行部分(T_e步)和缓冲部分
- 在执行前T_e步时,后台已开始推理下一个动作块
- 通过∆t_c参数确保动作块间无缝衔接
在实际部署中,我发现设置∆t_c=3、T_e=7时能在延迟和平滑度间取得最佳平衡。机器人可以持续运动而几乎感知不到推理间隔。
3.2 Λ形注意力掩码
这是论文中最精妙的设计之一,解决了异步执行中的关键矛盾:
- 问题:如果让当前预测过度依赖之前动作,模型会变得"懒惰",只是简单复制之前动作而忽略新观察
- 解决方案:采用Λ形掩码,限制后续时间步对前缀动作的关注
- 效果:既保持了动作连贯性,又确保对新观察的及时响应
具体实现上,模型会:
- 对噪声动作token的RoPE位置添加偏移量
- 使用特殊设计的注意力掩码模式
- 动态调整不同时间步的关注权重
4. 数据准备与训练策略
4.1 多源数据集构建
模型训练使用了超过2亿时间步的机器人数据,主要包括:
-
公开数据集:
- DROID:包含多种日常操作任务
- MolmoAct:专注于精细动作控制
-
自建数据集:
- 乐高拆卸:338小时操作记录
- 毛巾折叠:400小时专业演示
视觉语言数据则整合了超过8000万样本,特别强化了四种能力:
- 机器人视角下的物体定位
- 具身推理与规划
- 以机器人为中心的VQA
- 操作场景描述生成
4.2 两阶段训练流程
4.2.1 预训练阶段
采用1:6的比例混合视觉语言数据和机器人数据,这种配比经过精心设计:
- 足够多的机器人数据确保动作生成质量
- 适量视觉语言数据防止语义能力退化
在第一阶段,所有参数共同更新;第二阶段则冻结VLM,专注训练DiT部分。这种分阶段策略既保证了知识迁移,又避免了灾难性遗忘。
4.2.2 后训练阶段
专注于特定机器人的适配,关键创新包括:
- 动态重加权:对误差大的样本给予更高权重
- 随机∆t_c采样:增强模型鲁棒性
- 延迟模拟:在训练中模拟真实推理延迟
5. 实战性能与优化建议
5.1 基准测试结果
在三大标准测试中,Xiaomi-Robotics-0均表现优异:
-
LIBERO测试:
- 平均成功率提升15%以上
- 特别擅长空间推理任务
-
CALVIN评估:
- ABC→D设置下任务链完成率提高22%
- 展示了强大的跨环境泛化能力
-
SimplerEnv:
- 在视觉干扰下保持稳定性能
- 对真实-仿真差异表现出良好适应性
5.2 实际部署经验
基于项目实践,我总结出以下优化建议:
-
硬件配置:
- 至少需要24GB显存的GPU
- 建议使用TensorRT加速推理
-
参数调优:
- 动作块长度T根据任务复杂度调整
- 执行步数T_e应略大于推理延迟
-
故障处理:
- 设置动作变化率阈值防止异常
- 添加安全层检查物理可行性
6. 应用前景与扩展方向
这个框架最令人兴奋的不只是当前性能,更是其可扩展性。我们已经尝试在几个方向进行延伸:
-
多模态扩展:
- 加入力觉和触觉反馈
- 整合音频输入输出
-
任务泛化:
- 实现零样本任务理解
- 开发元学习版本
-
效率优化:
- 知识蒸馏缩小模型尺寸
- 量化到INT8精度
在实际机器人应用中,这种端到端的VLA模型正在改变我们编程机器人的方式。从工业装配到家庭服务,只需要用自然语言描述需求,机器人就能自主完成复杂操作序列。随着模型进一步开源和优化,很可能会催生新一代智能机器人生态系统。
