1. 视觉语言模型在具身智能中的悖论:现象与挑战
在具身智能(Embodied AI)领域,一个普遍存在的假设是:视觉语言模型(VLM)在图像理解和语言推理上的优异表现,能够直接转化为机器人控制任务的性能提升。这个看似合理的推论,最近被清华大学和阿里巴巴Qwen团队的系统性研究彻底颠覆。他们通过超过100组对照实验发现,VLM的通用能力提升与机器人控制性能之间存在着令人惊讶的"具身悖论"——99%的通用能力提升,可能对1%的控制任务毫无帮助。
1.1 研究背景与核心发现
这项名为VLM4VLA的研究构建了一个极简但严谨的测试框架,对24种不同的VLM在机器人控制任务上的表现进行了系统评估。研究团队设计了三个具有不同挑战维度的测试环境:
- Calvin ABC-D:测试视觉泛化能力,在A/B/C三种配色场景训练,在完全不同的D场景测试
- SimplerEnv Bridge:评估sim-to-real迁移能力,使用真实机器人数据训练但在仿真环境测试
- Libero-Long:验证长时序泛化能力,包含10个涉及多物体交互的复杂任务链
实验结果揭示了三个反直觉的发现:
- 强者未必恒强:在Calvin任务表现优异的VLM(如Qwen系列),在SimplerEnv和Libero任务中可能落后于参数小得多的模型(如1.7B的Kosmos-2)
- 针对性训练反而有害:在具身相关辅助任务(如视觉定位、动作预测)上微调的VLM,其控制性能反而低于原始baseline
- 瓶颈在视觉而非语言:通过模块级消融实验发现,视觉编码器的适应性才是性能关键,而非语言理解能力
1.2 具身悖论的本质
这个现象被研究者形象地比喻为"造了一个超级观众,却指望它上场打比赛"。VLM在被动观察和理解世界方面表现出色,但当需要主动与环境交互时,这些能力可能无法有效转化。根本原因在于:
标准VLM的视觉表征针对语义理解优化(识别物体、理解关系),而机器人控制需要的是物理层面的可操作性表征(抓取角度、力度控制、运动轨迹)。这两种能力在特征空间中存在根本性分叉。
研究通过特征空间轨迹分析显示,VLM和VLA(Vision-Language-Action)模型在初期都学习基础的视觉理解,但在中期开始分道扬镳——VLM向高层语义问题优化,而VLA需要向低层控制问题优化。
2. 研究方法与技术实现
2.1 VLM4VLA测试框架设计
研究团队采用"最小化干预"原则构建测试平台,核心架构包含三个关键组件:
- 基础VLM:保持原始预训练权重,仅添加1%的新参数
- 动作查询令牌(Action Query Token):可学习的特殊token,从VLM最后一层提取控制相关信息
- MLP解码器:轻量级网络(2层,隐藏维度256)将特征映射为机器人动作序列
python复制class VLM4VLA(nn.Module):
def __init__(self, vlm_backbone):
super().__init__()
self.vlm = vlm_backbone # 冻结的预训练VLM
self.action_token = nn.Parameter(torch.randn(1, 1, vlm_backbone.config.hidden_size))
self.mlp = nn.Sequential(
nn.Linear(vlm_backbone.config.hidden_size, 256),
nn.ReLU(),
nn.Linear(256, action_dim)
)
def forward(self, images, texts):
with torch.no_grad():
vlm_outputs = self.vlm(images, texts)
action_features = vlm_outputs.last_hidden_state[:, -1] # 提取动作token特征
return self.mlp(action_features)
2.1.1 关键设计选择背后的考量
为什么选择MLP而非Diffusion解码器?
虽然扩散模型理论上能生成更复杂的动作分布(如π0模型所用方案),但实验发现其随机性会导致±20%的成功率波动。对于需要精确比较的研究,确定性的MLP虽然性能上限可能略低,但能保证结果可复现。
为何排除本体感知信息?
许多VLA模型会输入关节角度、末端执行器状态等本体信息。研究刻意排除这些输入,纯粹测试VLM本身的视觉语言能力对控制的贡献,避免多模态融合带来的混淆。
如何处理不同VLM的输入格式差异?
研究发现prompt格式对性能影响显著(2-3%差异)。团队为每个VLM严格匹配其原生监督微调(SFT)格式,包括:
- 系统角色设定(如Qwen系列)
- 特殊分隔符(如Kosmos-2的
<image>标记) - 问答模板(如Paligemma的"Q: A:"格式)
2.2 评估协议与基准选择
研究采用了三重评估体系,每个基准针对不同的泛化维度:
| 基准名称 | 核心挑战 | 任务复杂度 | 评估指标 |
|---|---|---|---|
| Calvin ABC-D | 视觉泛化 | 1-5步连续 | 平均完成子任务数 |
| SimplerEnv Bridge | sim-to-real迁移 | 单步操作 | 成功率(60次试验) |
| Libero-Long | 长时序规划 | 10步组合 | 完整任务链成功率 |
特别值得注意的是,团队有意选择了各基准中最困难的配置:
- Calvin中使用完全未见过的D场景配色
- SimplerEnv选择Bridge而非更简单的Fractal子集
- Libero选择Long套件而非基础任务
这种"高压测试"设计是为了放大不同VLM的性能差异,更清晰地揭示能力边界。
3. 实验结果与深度分析
3.1 反直觉现象的系统验证
3.1.1 通用能力与控制性能的背离
研究测试了9种主流VLM在三个基准上的表现,包括:
- Qwen系列:2.5VL和3VL,参数从2B到30B
- Paligemma:专为下游微调优化的1代和2代模型
- Kosmos-2:专注视觉定位的1.7B小模型
结果展现出明显的任务依赖性:
| 模型 | Calvin ABC-D | SimplerEnv Bridge | Libero-Long |
|---|---|---|---|
| Qwen3VL-30B | 4.12 | 58.3% | 52.1% |
| Qwen3VL-2B | 4.14 | 59.7% | 53.8% |
| Kosmos-2 (1.7B) | 3.21 | 60.4% | 55.0% |
相关性分析显示:
- Calvin任务:通用VQA能力与性能强相关(r=0.839)
- SimplerEnv:弱负相关(r=-0.358)
- Libero:几乎无关(r=-0.194)
这表明不同机器人任务需要的能力谱系不同:
- 语义主导型任务(如Calvin):依赖物体识别和指令理解,与标准VQA能力匹配
- 控制主导型任务(如SimplerEnv/Libero):需要精细的空间操作能力,这在常规VLM评测中未被考察
3.1.2 辅助训练的反效果
研究在五种具身相关辅助任务上微调Qwen2.5-VL:
- Robopoint(视觉定位)
- Vica-332k(空间关系判断)
- Robo2vlm(动作预测)
- Robobrain2(具身VQA)
- Omni-Generation(3D感知)
尽管在各自任务上取得显著提升(+20%到+60%),但这些微调模型在控制任务中全部表现更差:
| 微调任务 | Calvin ABC-D | 性能变化 |
|---|---|---|
| Baseline | 3.87 | - |
| +Robopoint | 3.52 | -9.0% |
| +Vica-332k | 3.41 | -11.9% |
| +Robo2vlm | 3.29 | -15.0% |
这种现象可能源于:
- 任务范式不匹配:辅助任务多是离散答案预测,而控制需要连续动作生成
- 特征空间扭曲:微调使模型过度适应特定答题模式,损害了原始通用能力
3.1.3 视觉编码器的关键作用
通过冻结实验发现,视觉编码器的可训练性对性能起决定性作用:
| 训练配置 | SimplerEnv 成功率 |
|---|---|
| 全参数微调 | 61.2% |
| 冻结视觉编码器 | 43.1% |
| 仅微调视觉编码器 | 59.8% |
| 仅微调语言模型 | 45.3% |
进一步的交叉实验证明,视觉编码器需要学习的是控制相关特征而非简单的仿真图像适应:
- 在真实图像(BridgeV2)上预训练动作预测任务
- 分别冻结/微调视觉编码器
- 迁移到仿真控制任务
结果显示,即使预训练使用真实图像,视觉编码器的可微调性仍带来+18.1%的性能提升,证实了控制专用视觉特征的存在。
3.2 特征空间的可视化分析
研究通过t-SNE降维展示了VLM和VLA在特征空间中的分叉现象:

- 初期(浅层):两类模型的特征分布高度重叠,都学习基础视觉元素(边缘、颜色、纹理)
- 中期:VLM开始聚类语义概念(物体类别、场景类型),VLA转向动作相关特征(抓取区域、运动方向)
- 后期(深层):两者几乎完全分离,VLM专注于高级语义,VLA聚焦于可操作属性
这解释了为什么直接使用预训练VLM会遭遇瓶颈——它们的深层特征已经朝着与控制任务不同的方向优化。
4. 对具身智能领域的启示
4.1 重新思考VLM的评价体系
当前VLM的评估主要围绕:
- 视觉问答(VQA)
- 图像描述(Captioning)
- 视觉推理(Visual Reasoning)
这项研究表明,对于具身应用,我们需要新的评价维度:
- 控制适应性:视觉特征微调后的提升幅度
- 动作相关性:特征与机器人动作的线性可分程度
- 跨任务一致性:在不同控制任务中的表现稳定性
建议的评测补充方案包括:
- Affordance预测任务:给定物体图像,预测可能的交互方式
- 动作特征线性探测:冻结VLM,用简单分类器测试动作预测准确率
- sim-to-real迁移测试:验证学习特征在仿真和真实场景的一致性
4.2 新型预训练范式的可能性
研究发现暗示,可能需要突破现有的"预训练+微调"范式:
4.2.1 分阶段具身预训练
- 通用视觉语言阶段:继承现有VLM的语义理解能力
- 控制特征对齐阶段:在大规模机器人数据上学习通用控制特征
- 不针对具体机器人或任务
- 学习跨实施例的可操作性表征(如抓取affordance、运动轨迹基元)
- 任务特定微调阶段:快速适配到具体应用场景
4.2.2 双通路架构探索
受生物视觉系统启发,可能需要分离:
- 语义通路:专注于物体识别、场景理解(类似腹侧流)
- 控制通路:处理空间关系、动作规划(类似背侧流)
两通路可在早期视觉层共享,在高层分别 specialization,最后通过注意力机制动态整合。
4.3 实践建议与注意事项
基于研究发现,给从业者的实用建议:
选择VLM时:
- 不要盲目追求大参数或高VQA分数
- 优先测试其在目标控制任务上的可微调性
- 小模型(如Kosmos-2)可能在空间任务中表现更优
微调策略:
- 始终微调视觉编码器,至少部分层
- 谨慎使用具身辅助任务,监控其对控制性能的影响
- 保留一定比例的通用数据防止能力退化
架构设计:
- 动作解码器首选简单确定的MLP,除非有充足计算资源进行扩散模型的多轮采样
- 为不同VLM严格匹配其原生prompt格式
- 考虑添加轻量级的控制专用视觉适配器(Adapter)
5. 待解问题与未来方向
尽管这项研究揭示了重要现象,仍有许多开放问题值得探索:
5.1 规模定律的适用性
当前测试最大模型是30B参数的Qwen3VL-MoE。当模型规模继续增大时:
- 是否会出现"控制能力涌现"?
- 模型能否同时保持语义理解和精细控制?
- 计算效率与性能的平衡点在哪里?
5.2 真实世界的复杂性
仿真环境无法完全复现的现实挑战:
- 动态光照和遮挡
- 非刚性物体形变
- 传感器噪声和执行器误差
需要验证这些因素如何影响VLM的适用性
5.3 多模态融合策略
研究刻意隔离了VLM的贡献,但实际系统需要整合:
- 本体感知(关节角度、力觉)
- 触觉反馈
- 听觉信号
如何设计不破坏VLM原有能力的融合机制是关键
5.4 从模仿学习到强化学习
当前实验基于行为克隆(BC)。在强化学习(RL)设定下:
- VLM的语言理解能力可能更关键(用于奖励塑造)
- 在线交互可能缓解特征不对齐问题
- 探索-利用权衡需要新的架构支持
6. 个人实践心得
在实际机器人项目中应用这些发现时,我总结了以下几点经验:
视觉编码器微调的艺术:
- 底层卷积层通常需要较小学习率(主干的1/5到1/10)
- 中层注意力模块最需要适应性,可适当增大学习率
- 高层语义模块有时需要冻结以防止灾难性遗忘
小批量训练的陷阱:
- 当batch size较小时,BN层统计量可能不准
- 解决方案:使用预计算的BN统计量,或切换到GN层
动作解码的稳定性技巧:
- 为MLP输出添加低通滤波(α=0.3的指数平滑)
- 对连续动作进行动态范围缩放
- 在训练初期添加动作噪声防止过拟合
真实机器人部署的注意事项:
- 仿真到现实的视觉gap可能使VLM特征失效
- 建议:在目标环境采集少量数据做域适应
- 紧急停止机制必不可少,特别是在初期测试阶段
这项研究最深刻的启示是:具身智能需要自己的"基础模型"范式,不能简单照搬NLP或CV的模式。我们需要建立兼顾通用性和控制特异性的新架构,这可能是下一代机器人学习系统的关键突破点。
