1. 项目概述:HIL-DAFT框架的革新意义
去年8月我在行业观察中就预测过,视觉-语言-动作模型(VLA)与强化学习的结合将成为工业自动化的重要技术路线。如今小米与香港城市大学联合发布的HIL-DAFT框架,完美验证了这一判断。这个针对双足人形机器人设计的双智能体系统,通过创新的"对话与微调"机制,在螺栓装配任务中仅用101分钟在线学习就达到100%子任务成功率,其技术突破值得深入剖析。
传统工业机器人的编程模式存在明显局限:一方面,示教再现方式缺乏灵活性;另一方面,纯强化学习方法的样本效率低下且存在安全隐患。HIL-DAFT的突破性在于:
- 主智能体(Primary Actor)负责生成基础动作序列,维持整体任务稳定性
- 精细化智能体(Refinement Actor)在潜在噪声空间运作,根据语音指令进行毫米级调整
- 人类专家通过SpaceMouse的物理干预会被实时转化为自然语言指令(如"向右微调2mm"),形成闭环学习
这种架构既保留了VLA模型的多任务泛化能力,又通过人类在环(Human-in-the-Loop)机制确保了操作安全性。在装配流水线实测中,系统对螺栓插入位置的调整精度达到±0.5mm,远超传统PID控制的±2mm公差范围。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术解析:双智能体协同机制
2.1 扩散策略与噪声空间分解
框架的核心创新在于对扩散策略噪声空间的创造性利用。传统一致性策略(Consistency Policy)的动作生成公式为:
math复制a = \pi_\theta(h), h=\mathcal{V}_{\tau_{pre}}(s,l_{task})
而HIL-DAFT将噪声向量w的采样过程拆分为两种模式:
- 主模式:w ~ N(0, K²I),保持基础策略行为
- 细化模式:w ~ N(μ, K²I),其中μ=πφ(s,lrf)
这种设计带来三个关键优势:
- 主智能体维持全局策略稳定性
- 精细化调整仅在潜在空间进行,避免破坏已学习技能
- 语言指令通过T5编码器转化为噪声偏移量,实现语义到动作的精确映射
2.2 离线-在线混合训练流程
训练过程分为两个关键阶段:
阶段一:离线预热(Warm-up)
- 使用Calibrated Q-Learnin
