1. 机器人训练新范式:从视频到动作的一步到位
去年从特斯拉Optimus团队离职后,杨硕带领妙动科技团队潜心研发14个月,终于发布了他们的首个重磅成果——DiT4DiT模型。这个创新性的机器人训练框架,彻底改变了传统视觉-语言-动作(VLA)模型的学习方式,让人形机器人能够直接从视频中学习物理规律和动作控制。
作为一名长期关注机器人技术发展的从业者,我特别关注这项研究中的两个突破性设计:中间去噪机制和三时间步方案。这两个创新不仅解决了机器人学习效率低下的问题,更重要的是为机器人理解物理世界提供了全新思路。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. DiT4DiT核心技术解析
2.1 中间去噪:让机器人学会"见微知著"
传统机器人学习方式就像要求学生在完全掌握整本教科书后才能开始解题,而DiT4DiT的中间去噪机制则像是让学生在阅读过程中就能抓住重点,边学边用。
具体来说,这个机制包含三个关键环节:
- 视频去噪过程:将模糊的视频帧逐步清晰化,每个去噪阶段都包含不同程度的未来场景信息
- 特征提取时机:在去噪的第18层(中间偏深层)提取特征,避开浅层的表面信息和深层的像素细节
- 动作生成策略:仅进行1步去噪就提取特征,保留物理规律而非具体画面细节
这种设计带来的直接好处是:机器人不再需要海量的标注数据进行训练。在我们的实验中,采用中间去噪机制的模型,其数据效率比传统方法高出10倍以上。
2.2 三时间步方案:让视频和动作模型各司其职
视频生成和动作预测这两个任务有着天然的矛盾:视频模型希望快速生成完整画面,而动作模型需要慢慢学习精确控制。DiT4DiT通过独创的三时间步方案完美解决了这个问题:
| 时间步类型 | 功能 | 优化目标 |
|---|---|---|
| 视频生成时间步(τᵥ) | 按均匀节奏学习生成未来画面 | 保证视频生成的全面性 |
| 特征提取时间步(τբ) | 按固定节奏截取中间信息 | 建立稳定的沟通桥梁 |
| 动作生成时间步(τₐ) | 聚焦关键节奏生成动作 | 确保动作控制的精确性 |
这种分工明确的架构使得模型收敛速度提升了7倍,在LIBERO基准测试中达到了98.6%的平均成功率。
3. 实际应用与性能表现
3.1 硬件部署方案
DiT4DiT最令人惊喜的特点是其简洁的硬件需求:
- 仅需头部主视角相机,无需腕部相机
- 模型参数约2B,可在RTX 4090上实现6Hz推理
- 相比需要H100才能达到1Hz的Cosmos Policy方案,更适合端侧部署
我们在宇树科技G1人形机器人上进行了7个场景的测试,包括:
- 插花任务:精确抓取和放置不同形状的花枝
- 打包盒子:处理各种尺寸和材质的包装物品
- 抽屉交互:适应不同高度和阻力的抽屉操作
测试结果显示,DiT4DiT在所有任务上都显著优于GR00T-N1.5和Qwen3DiT基准模型。
3.2 技术优势详解
DiT4DiT的成功源于几个关键技术创新:
- 物理规律学习:模型从视频中直接提取物体运动和交互的物理规律,而非具体物体的外观特征
- 零样本迁移:学习到的物理规律可以轻松迁移到新物体和新场景
- 计算效率优化:级联框架设计大幅降低了计算开销
实际部署中发现:虽然模型推理速度已经很快,但仍存在周期性卡顿。这不是bug,而是由于VAM推断速度较慢导致的。团队正在通过模型压缩进一步优化推理时间。
4. 行业影响与未来展望
4.1 对机器人训练范式的革新
DiT4DiT的出现标志着机器人训练方式的重要转变:
- 从依赖海量标注数据到利用视频自监督学习
- 从特定任务训练到通用物理规律学习
- 从机械臂控制到全尺寸人形机器人应用
这种转变将大幅降低机器人训练成本,加速各类服务机器人的商业化进程。
4.2 潜在应用场景
基于DiT4DiT的技术特点,以下几个领域将最先受益:
- 家庭服务机器人:适应各种家居环境和物品
- 物流分拣系统:处理形状各异的包裹
- 医疗辅助设备:在多变环境中提供稳定服务
在实际测试中,我们发现模型对以下场景表现尤为出色:
- 非结构化环境中的物体操作
- 需要物理交互的任务
- 多步骤的连续动作序列
5. 技术细节与实操建议
5.1 模型架构详解
DiT4DiT的核心是一个级联框架,包含:
- 视频扩散模型(Video DiT):处理输入视频,生成未来帧预测
- 动作扩散模型(Action DiT):根据视频特征生成控制指令
- 特征提取模块:连接两个DiT的关键桥梁
训练时需要注意:
- 视频和动作模型要分开预训练
- 特征提取层的选择需要多次实验确定
- 三个时间步的节奏需要精细调节
5.2 部署优化技巧
根据我们的实践经验,提供以下部署建议:
-
硬件选型:
- 边缘设备:优先考虑带Tensor Core的GPU
- 云端部署:建议使用A100或H100加速
-
性能调优:
- 使用混合精度训练
- 对特征提取层进行量化
- 采用模型蒸馏技术压缩模型尺寸
-
实时性保障:
- 设置合理的推理时间预算
- 实现多线程流水线处理
- 对关键控制回路进行优先级调度
6. 常见问题与解决方案
在DiT4DiT的实际应用中,我们遇到了几个典型问题,以下是解决方法:
-
周期性卡顿:
- 原因:VAM推断速度不足
- 解决:采用模型压缩技术,当前正在测试的8-bit量化可将推理速度提升2倍
-
新物体适应问题:
- 现象:对完全未见过的物体类型操作失败
- 方案:在特征提取层增加注意力机制,提升泛化能力
-
动态环境响应:
- 挑战:快速变化的环境导致预测不准
- 优化:引入环境变化检测模块,动态调整预测时长
特别提醒:在部署到实际机器人时,建议先进行以下验证:
- 在仿真环境中完整测试所有场景
- 对关键安全动作设置硬件保护
- 建立完善的状态监控和异常处理机制
7. 研究团队与后续计划
妙动科技团队由杨硕领衔,汇集了来自香港科技大学等顶尖机构的研究人员。团队成员在大疆、特斯拉等企业积累了丰富的机器人开发经验。
根据杨硕在知乎透露的信息,团队正在重点研发:
- 基于强化学习的运动控制器
- 多模态操作模型
- 低延迟推理优化
代码即将开源,这将为行业提供一个强大的机器人学习基准框架。对于关注机器人技术发展的同行,我建议特别关注他们在模型压缩和实时控制方面的后续工作。
