1. 残差动作世界模型(ResWM)的核心思想
在视觉强化学习领域,从原始像素输入中学习有效的世界模型一直是个棘手难题。传统方法直接将未来状态预测与绝对动作挂钩,这种看似直观的做法实际上引入了诸多问题。想象一下,如果每次控制机器人手臂时,都需要从头开始计算每个关节的绝对角度,而不是基于当前位置做微调,那会是多么低效且不稳定的过程。
ResWM的突破性在于将控制变量从绝对动作重新定义为残差动作(即相对于前一步的增量调整)。这种设计灵感来源于人类运动控制的基本原理——我们的每个动作都是在前一个姿势基础上的自然延伸。比如写字时,笔画的连续性来自于手腕对前一笔位置的微小调整,而非每笔都重新规划绝对位置。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 传统方法的局限性分析
2.1 绝对动作建模的缺陷
主流世界模型如Dreamer直接将潜动力学建立在绝对动作之上,这导致三个关键问题:
- 高方差优化:最优绝对动作分布高度依赖具体任务且非平稳,使策略学习变得不稳定
- 控制抖动:独立预测的动作序列缺乏时间连续性,产生机械振荡(如机械臂的"抽搐"现象)
- 能效低下:频繁大幅调整执行器位置导致不必要的能量消耗
这些问题在真实机器人部署中尤为突出。例如,四足机器人ANYmal在传统方法控制下,其关节电机温度会比ResWM控制时高15-20%,直接影响设备寿命。
2.2 视觉表征的挑战
传统帧堆叠(frame stacking)方法虽然能隐式捕捉运动信息,但存在两个固有缺陷:
- 信息冗余:静态背景像素占用了大量表示容量
- 混叠效应:相似外观的不同动态状态无法区分
这就像试图通过连续照片判断乒乓球运动轨迹——如果只关注球的位置变化而非整个画面,判断会准确得多。
3. ResWM的技术实现
3.1 残差动作策略
ResWM的核心公式看似简单却极为有效:
code复制a_t = tanh(a_{t-1} + δa_t), 其中δa_t ∼π_θ(·|z_t,a_{t-1})
这种设计带来了三个关键优势:
- 缩小搜索空间:将全局动作搜索转化为局部优化
- 嵌入平滑先验:自然限制动作变化率
- 物理可行性:符合真实执行器的惯性约束
在实际实现中,策略网络输出的是均值为0的高斯分布
