1. 论文核心创新点解析
AVA-VLA这篇论文的核心贡献在于重新思考了视觉-语言-动作(VLA)模型的底层理论基础。现有VLA模型大多基于马尔可夫决策过程(MDP)假设,即认为当前视觉观察包含了决策所需的全部信息。但作者敏锐地指出,在真实机器人操作场景中,这实际上是一个部分可观测马尔可夫决策过程(POMDP)问题。
关键突破:将循环状态(recurrent state)作为信念状态(belief state)的神经近似,并设计AVA模块实现历史感知的视觉处理
这种理论重构带来了几个显著优势:
- 能够基于历史上下文动态调整当前视觉关注区域
- 有效过滤时间维度上的冗余视觉信息
- 在遮挡等部分观测场景下保持鲁棒性
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术实现细节剖析
2.1 整体架构设计
AVA-VLA的架构包含三个关键组件:
- 循环状态编码器:通过MLP将上一时间步的隐藏状态映射为低维表示
$$ r^{t-1} = \mathcal{B}(h_M^{t-1}) \in \mathbb{R}^{L_A \times d} $$ - AVA模块:核心创新点,包含特征编码、FiLM条件化、交叉注意力等子模块
- 基于状态的初始化:使用循环状态初始化动作占位符嵌入
2.2 AVA模块工作流程
-
特征编码与条件化:
- 使用模态特定MLP编码视觉和语言特征
- 通过FiLM实现视觉特征的语言条件化:
$$ \hat{z}I^t = \mathcal{F}\gamma(\bar{z}_S^t) \odot \bar{z}I^t + \mathcal{F}\beta(\bar{z}_S^t) $$
-
注意力机制设计:
- Query:条件化后的视觉特征
- Key/Value:循环状态表示
- 计算过程:
$$ \mathbf{Q}^t = W_Q\hat{z}_I^t, \quad \mathbf{K}^t, \mathbf{V}^t = (W_K/W_V)\hat{r}^{t-1} $$
-
软权重预测与应用:
- 预测每个视觉token的重要性权重:
$$ \rho^t = \text{Softmax}(W(\text{FFN}(\mathbf{O}^t))) \in \mathbb{R}^{L_I \times 2} $$ - 修改注意力矩阵实现动态调制:
$$ \mathbf{A}{i,j}^{t,m} = \frac{\exp(\mathbf{C}^{t,m})\mathbf{U}{i,j}^t}{\sum^{L_o^t}\exp(\mathbf{C}{i,l}^{t,m})\mathbf{U}^t} $$
- 预测每个视觉token的重要性权重:
3. 实验设计与结果分析
3.1 基准测试表现
在LIBERO基准测试中,AVA-VLA展现出显著优势:
| 方法 | Spatial | Object | Goal | Long | Average |
|---|---|---|---|---|---|
| OpenVLA-OFT | 97.7 | 98.0 | 96.1 | 95.3 | 96.8 |
| AVA-VLA | 97.4 | 99.4 | 97.4 | 97.6 | 98.0 |
特别值得注意的是在LIBERO-Long套件上的表现(96.2%→97.6%),验证了方法对长序列任务的适用性。
3.2 真实机器人实验
在Mobile ALOHA平台上的实验结果更具说服力:
| 任务 | UniVLA | OpenVLA-OFT | AVA-VLA |
|---|---|---|---|
| Pick and Place | 67.5 | 85.9 | 96.2 |
| Sequenced Instruction | 70.0 | 76.7 | 93.3 |
| Flexible Object Folding | 79.1 | 91.7 | 100 |
| Dexterous Action | 54.2 | 83.3 | 95.8 |
这些结果不仅证明了方法的有效性,更展示了出色的sim-to-real迁移能力。
4. 关键发现与工程启示
-
视觉token剪枝潜力:
- 即使剪除70%的视觉token,模型仍保持97.3%的成功率
- 为降低计算开销提供了明确方向
-
注意力动态可视化:
- 模型能自动聚焦于机器人手臂接触区域
- 在"put both moka pots on the stove"任务中展现出优秀的物体追踪能力
-
训练技巧:
- 采用截断BPTT(T=4)平衡训练效率与长程依赖
- 软权重正则化(L2惩罚)防止注意力过度集中
5. 局限性与改进方向
当前方法存在几个值得关注的限制:
-
计算效率问题:
- 虽然展示了剪枝潜力,但实际推理时仍处理全部视觉token
- 未来可探索动态token选择机制
-
循环状态容量限制:
- 固定维度的循环状态可能难以捕获复杂的长程依赖
- 可考虑引入分层或可扩展的记忆机制
-
多模态扩展:
- 当前仅处理视觉和语言模态
- 触觉、力反馈等传感器信息的融合值得探索
6. 复现建议与注意事项
对于希望复现或改进此工作的研究者,建议重点关注:
-
实现细节:
- 循环状态维度需要与任务复杂度匹配
- FiLM条件化的超参数调优至关重要
-
训练技巧:
- 采用渐进式训练策略,先固定视觉编码器微调AVA模块
- 合理设置软权重正则化强度(λ)
-
部署考量:
- 实际部署时注意循环状态的初始化策略
- 考虑添加异常状态检测与恢复机制
在实际应用中我们发现,适当降低初始学习率(3e-5→1e-5)并采用余弦退火调度,能显著提升训练稳定性。此外,在长序列任务中,将截断长度T从4增加到8可进一步改善性能,但会线性增加内存消耗。
