1. SpaceDrive:重新定义VLM在自动驾驶中的空间理解能力
自动驾驶领域正在经历一场由视觉语言模型(VLM)引发的技术变革。传统基于规则或纯视觉的方法往往难以处理复杂场景下的语义理解和决策推理,而VLM凭借其强大的视觉理解和自然语言处理能力,为自动驾驶系统带来了前所未有的语义推理能力。然而,当我们真正尝试将VLM应用于实际的驾驶规划任务时,一个根本性问题浮出水面:VLM擅长理解"场景在表达什么",却难以精确把握"目标具体在哪里、几何关系是什么、轨迹在三维空间里是否真的可执行"。
奔驰研究团队在CVPR 2026上提出的SpaceDrive,正是针对这一核心挑战的突破性解决方案。不同于简单地让VLM"读数字、猜坐标",SpaceDrive构建了一套统一、显式、可计算的三维空间接口,使视觉输入、文本描述、历史状态和规划输出能够在同一空间表示域中进行无缝交互。这种方法从根本上改变了VLM处理空间信息的方式,将自动驾驶系统的空间理解能力提升到了新的高度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 现有VLM-based自动驾驶的空间理解瓶颈
2.1 数字token与空间表征的本质差异
当前大多数VLM-based自动驾驶方法存在一个根本性的设计缺陷:它们将坐标信息简单地视为数字字符串,让语言模型像生成普通文本一样逐位生成轨迹坐标。这种处理方式带来了两个关键问题:
首先,数字token本质上只是离散符号序列。对语言模型而言,"3.82"更接近于由字符"3"、"."、"8"、"2"组成的序列,而非"图中某辆车前右侧3.82米的位置"这样的空间概念。模型可能正确识别了数字,却未能建立数字与视觉语义之间的稳定对应关系。
其次,离散token生成不适合连续坐标建模。轨迹本质上是连续的几何量,而语言模型的输出机制本质上是分类任务。虽然VLM可以拟合文本分布,但在高精度数值回归任务上表现欠佳。这导致许多方法在开环测试中尚能拟合专家轨迹,一旦进入闭环场景,就会出现近线性塌缩、航向振荡、碰撞或越界等问题。
2.2 空间接口设计错误的严重后果
SpaceDrive论文通过详实的实验证明,如果空间接口本身设计不当,即使拥有强大的语义理解能力,VLM也难以转化为可靠的驾驶能力。例如,在Bench2Drive闭环基准测试中,采用纯文本轨迹生成的基线模型(OmniDrive)成功率低于10%,预测轨迹经常塌缩为近线性路径并伴随严重的航向振荡。
这一现象清晰地表明:仅靠自然语言拟合轨迹,并不等同于真正掌握了可控的驾驶策略。自动驾驶需要的是对三维空间的精确理解和对物理约束的严格遵守,而这些恰恰是传统VLM处理方式所欠缺的。
3. SpaceDrive的核心创新:统一3D空间接口
3.1 基本设计理念
SpaceDrive的核心思想非常直接:为VLM构建一套统一的3D positional encoding(PE)接口,使视觉输入、文本中的坐标、历史ego位置以及最终输出的轨迹坐标都共享同一套空间编码方式。这种设计彻底改变了VLM处理空间信息的方式,从"视觉token+数字token"的混合表示,转变为"视觉语义+显式空间token"的统一表征。
这种转变的意义在于:模型内部的各种元素现在都存在于同一个空间语义体系中,注意力机制不再需要"猜测"哪个数字对应哪个目标,而是可以直接在统一的空间表征上进行精确的索引和对齐。
3.2 技术实现细节
3.2.1 视觉侧的空间编码
SpaceDrive首先使用冻结的深度估计器(如DepthAnythingV2或UniDepthV2)从多视角图像中预测绝对深度,再结合相机标定参数,将每个图像patch的中心投影到3D空间,获得对应的三维坐标:
code复制(x,y,z) = project_to_3d(patch_center, depth, camera_params)
接着,使用统一的PE encoder将三维坐标编码为向量:
code复制pe = PE_encoder(x,y,z)
其中各维度采用3D sine-cosine positional encoding:
code复制PE(pos, 2i) = sin(pos/10000^(2i/d_model))
PE(pos, 2i+1) = cos(pos/10000^(2i/d_model))
最后,将空间编码以可学习的方式加到视觉token上:
code复制visual_token' = visual_token + α·pe
这里的α是可学习的归一化系数,用于避免PE直接注入后扰乱预训练VLM的token norm分布。通过这种方式,模型不仅知道"这是车、那是锥桶",还能精确理解"这个token对应的目标在三维空间中的具体位置"。
3.2.2 文本侧的空间编码
为了保持空间表征的一致性,SpaceDrive在文本处理环节也进行了革新。传统方法中,文本提示中的坐标信息(如"前方3米处的车辆")被简单地当作数字字符串处理。SpaceDrive则会在tokenizer之后扫描文本中的坐标表达,提取数值部分,并使用与视觉侧相同的PE encoder将其转换为空间token,替换原来的数字token序列。
具体实现上,系统会在坐标前插入特殊指示符⟨IND⟩,避免与普通文本混淆。对于BEV轨迹坐标,z轴分量被设为0,使其仍能复用同一套空间编码。这一步骤的关键意义在于:将文本中的坐标也纳入与视觉一致的空间语义域,实现了跨模态的空间对齐。
3.2.3 输出侧的空间解码
在输出阶段,SpaceDrive采用了与传统VLM截然不同的处理方式。普通文本仍由语言头正常解码;但当模型预测到特殊标记⟨IND⟩时,后续hidden state不再走文本token分类路径,而是送入PE decoder直接回归坐标:
code复制if output == ⟨IND⟩:
coord = PE_decoder(hidden_state)
整个训练目标则定义为:
code复制L = L_text + λ·L_coord
其中坐标部分默认采用Huber loss。这种输出机制的改变不是简单的实现细节调整,而是建模范式的根本转变——将问题从"生成看起来像坐标的文本"转变为"预测真实的连续几何量"。
4. 实验验证与性能分析
4.1 开环性能测试
在nuScenes open-loop planning基准测试中,SpaceDrive+取得了显著优于现有VLM-based方法的结果:
| 指标 | 数值 | 对比基线改进 |
|---|---|---|
| 平均L2误差 | 0.32 m | -0.18 |
| 平均碰撞率 | 0.23% | -1.91% |
| 平均越界率 | 1.27% | -0.38% |
特别值得注意的是,这些成绩是在没有使用密集BEV特征的前提下实现的。这表明:只要三维空间接口设计正确,VLM本身就能有效处理几何与规划问题,无需依赖额外的BEV模块。
4.2 闭环性能测试
在更接近真实驾驶场景的Bench2Drive closed-loop benchmark上,SpaceDrive+的表现同样令人印象深刻:
| 指标 | 数值 |
|---|---|
| Driving Score | 78.02 |
| Success Rate | 55.11% |
虽然这不是整个榜单的最高分(SimLingo使用了更重的数据增强),但SpaceDrive+在一个结构更清晰、更易解释的框架下,将VLM-based planner的闭环能力提升到了实用水平。相比之下,base model OmniDrive的纯文本轨迹生成在闭环测试中成功率低于10%,充分证明了统一空间接口的必要性。
5. 消融研究与设计选择验证
5.1 PE注入位置的消融实验
SpaceDrive论文通过系统的消融实验验证了各个设计选择的合理性。在PE注入位置的消融中,研究人员比较了四种配置:
| 配置 | 误差指标 |
|---|---|
| 基线(不加PE) | 2.51/4.53/6.77 |
| 只给视觉token加PE | 1.88/2.45/2.36 |
| 只把文本坐标替换为PE | 2.42/5.06/8.94 |
| 视觉+文本统一PE | 1.80/1.88/4.21 |
结果清晰地表明:仅替换文本坐标几乎无效(甚至在部分指标上更差),真正有效的是先将视觉token空间化,再让文本坐标与之共享同一套表示。这是因为只有当视觉侧和文本侧都采用相同的PE时,坐标才能真正成为跨模态的可对齐空间接口。
在加入历史ego位置的同构PE后,性能进一步提升(0.32/0.23/1.27),说明统一空间表示不仅适用于视觉和文本,也适用于历史状态信息。
5.2 PE编码器/解码器设计的消融
在PE编码器和解码器的设计选择上,论文也进行了深入验证。基准配置(Sine-Cosine encoder + coordinate-wise decoder)取得了最佳结果(1.80/1.88/4.21),而其他变体表现相对较差:
| 配置 | 误差指标 |
|---|---|
| MLP encoder + coordinate-wise decoder | 1.96/3.17/6.76 |
| RoPE encoder + coordinate-wise decoder | 1.93/3.71/11.40 |
| Sine-Cosine encoder + Sine-Cosine decoder | 1.87/2.62/9.20 |
| Sine-Cosine encoder + task-specific decoder | 1.93/2.41/5.58 |
这些结果说明了几个关键点:
- Sine-Cosine encoder因其清晰的平移相对关系,明显优于可学习的MLP encoder
- RoPE encoder会导致与base VLM内部RoPE的混淆,不利于训练稳定
- 输出端直接做coordinate-wise回归效果最佳,反解Sine-Cosine编码或一次性解完整条轨迹都会降低性能
5.3 PE归一化的影响
PE的幅值归一化看似是一个小细节,实则对模型性能有显著影响。固定初始化下的不同α值表现:
| α值 | 误差指标 |
|---|---|
| 1 | 2.34/3.63/8.46 |
| 0.1 | 2.43/3.79/9.42 |
| 0.02 | 2.22/2.71/10.17 |
而采用可学习归一化后:
| α值(可学习) | 误差指标 |
|---|---|
| 1 | 1.82/2.04/4.62 |
| 0.1 | 1.80/1.88/4.21 |
| 0.02 | 1.86/2.03/5.42 |
这一消融揭示了Transformer中embedding范数的重要性:PE的范数直接影响空间token在注意力机制中的"发言权"。可学习归一化让模型自主找到语义token和空间token之间的合理平衡点。
5.4 对其他变量的鲁棒性
附录中的额外实验证明SpaceDrive的优越性不依赖于特定实现选择:
- 使用不同深度估计器(DepthAnythingV2 vs UniDepthV2)性能相近,说明方法不依赖特定深度模型
- 增加LoRA rank并未持续提升性能,反而在某些指标上变差,表明改进源自接口设计而非参数量增加
6. 实际应用中的注意事项
6.1 部署考量
在实际部署SpaceDrive时,有几个关键因素需要考虑:
-
深度估计质量:虽然SpaceDrive对不同的深度估计器表现稳健,但仍需确保深度估计的准确性和稳定性。在极端光照条件或特殊天气下,可能需要额外的传感器融合或后处理。
-
计算效率:统一的3D PE接口会增加一定的计算开销,需要权衡精度与实时性要求。在实际系统中,可以考虑对远处的物体使用较低分辨率的空间编码。
-
标定精度:相机标定参数的准确性直接影响视觉token的空间编码质量,需要建立严格的标定维护流程。
6.2 训练技巧
基于论文中的实验经验,训练SpaceDrive模型时需要注意:
-
学习率调整:由于引入了新的PE模块,可能需要调整学习率策略,特别是在微调预训练VLM时。
-
损失权重平衡:文本损失L_text和坐标损失L_coord之间的权重λ需要谨慎选择,通常从较小值开始逐步调整。
-
渐进式训练:可以先固定PE encoder/decoder训练其他部分,再联合微调所有参数。
7. 未来发展方向
SpaceDrive为VLM在自动驾驶中的应用开辟了新的可能性,同时也提出了若干值得探索的方向:
-
动态空间分辨率:根据物体距离和重要性动态调整空间编码的精度,平衡计算效率和定位准确性。
-
多模态传感器融合:将激光雷达、雷达等其他传感器的空间信息也纳入统一的PE框架。
-
时空联合建模:扩展当前的3D PE到4D(3D空间+时间),更好地处理动态场景理解和预测。
-
自适应PE策略:研究如何让模型自主决定何时以及如何利用空间信息,而不是固定地注入PE。
SpaceDrive的核心贡献在于它纠正了一个重要误区:空间不是语义的附属描述,而是自动驾驶中的一等公民。这项研究证明,只有当VLM拥有了正确的空间接口,其强大的语义理解能力才能真正转化为安全可靠的驾驶能力。这一见解不仅适用于自动驾驶领域,对机器人、AR/VR等需要空间智能的应用同样具有重要启示。
