1. 项目概述
在自动驾驶领域,视觉-语言模型(VLM)因其强大的认知能力而备受关注,但一直面临三大关键挑战:轨迹预测数值不精确、严重依赖语言标注、推理效率低下无法实时部署。LatentVLA通过创新性地引入自监督潜在动作预测和知识蒸馏机制,成功解决了这些难题。
这项由上海创智学院、OpenDriveLab和理想汽车联合提出的工作,在NAVSIM基准测试上以92.4的PDMS得分创造了新的SOTA记录。其核心创新在于:
- 完全摆脱了对语言标注的依赖
- 实现了VLM强大泛化能力与传统端到端方法效率的完美结合
- 在nuScenes基准测试上展示了出色的零样本泛化能力
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术创新解析
2.1 自监督潜在动作预测机制
传统VLM在自动驾驶应用中面临的根本问题是语言模型的离散化标记与连续驾驶动作空间的不匹配。LatentVLA的创新解决方案是构建一个两阶段的潜在动作学习框架:
第一阶段:环境动态编码
采用基于IDM的编码器从观测对中提取潜在动作,使用VQ-VAE进行动作离散化。关键设计是:
- 采样间隔统一设置为1秒,确保跨数据集一致性
- 使用DINOv2空间patch特征作为输入和预测目标
- 编码器采用带因果掩码的时空Transformer架构
第二阶段:自车动作解耦
引入轨迹条件机制,显式分离自车运动与环境变化:
code复制潜在动作 = 环境动态编码 + 自车轨迹条件
这种解耦设计使模型能够专注于学习纯粹的驾驶行为,避免了信息混杂导致的规划精度下降。
2.2 知识蒸馏架构设计
为实现VLM能力向高效视觉网络迁移,LatentVLA设计了精妙的蒸馏框架:
教师模型-学生模型交互
- 教师模型:基于Qwen2.5-VL构建,增强16个特殊动作token
- 学生模型:轻量级规划Transformer
- 蒸馏目标:最小化KL散度 $D_{KL}(P_{teacher}||P_{student})$
特征融合策略
采用多头注意力机制实现VLM与传统方法的特征融合:
code复制融合特征 = MHA(BEV特征, Proj(动作嵌入), Proj(动作嵌入))
其中MHA表示多头注意力,Proj为维度对齐投影层。
