1. CuriousVLA:自动驾驶领域的技术范式革新
在自动驾驶技术发展的十字路口,北京航空航天大学与清华大学联合团队提出的CuriousVLA架构,正在引发行业对视觉-语言-动作(Vision-Language-Action, VLA)系统设计范式的重新思考。这个看似激进的技术方案,其核心突破在于完全摒弃了传统自动驾驶系统中常见的Action Token设计和Diffusion Planner等复杂规划模块,转而纯粹依赖多模态大语言模型(MLLM)的自回归生成能力来完成轨迹规划任务。
这种设计理念的颠覆性体现在三个方面:首先,它消除了传统模块化架构中不同组件间的接口损耗;其次,通过端到端的自回归生成,系统能够更好地处理长尾场景;最重要的是,这种架构天然具备scaling特性——随着模型规模的扩大和训练数据的增加,系统性能可以持续提升而不受固有架构限制。在实际道路测试中,CuriousVLA已展现出对复杂城市场景的出色适应能力,特别是在处理"鬼探头"、施工区域绕行等传统系统容易失效的场景时,其决策流畅度比基准系统提升了约37%。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构深度解析:为什么选择纯MLLM路径?
2.1 传统VLA系统的设计局限
当前主流的自动驾驶VLA系统通常采用多阶段处理流程:视觉编码器提取特征→语言模型理解指令→专门的规划模块生成轨迹。这种架构存在几个根本性问题:
- 信息损失:每个模块间的特征转换都会造成信息衰减
- 误差累积:前序模块的错误会直接影响后续模块
- 扩展瓶颈:规划模块的能力上限受预设action space限制
以典型的Diffusion Planner为例,其需要预先定义离散化的动作空间(如转向角度分档、加速度等级),这种离散化处理在面对连续、高精度的控制需求时就会形成性能天花板。
2.2 CuriousVLA的核心创新点
CuriousVLA的解决方案是构建一个统一的MLLM框架,将视觉感知、语义理解和运动规划全部整合到单一的自回归生成流程中。其技术实现包含三个关键组件:
-
多模态编码器:采用改进的ViT-22B架构,支持同时处理:
- 多摄像头视频流(8x1280x720@10fps)
- 激光雷达点云(64线,10Hz)
- 车载传感器数据(IMU、轮速等)
-
世界模型接口:通过约50万个物理参数的隐式编码,使模型具备:
- 车辆动力学理解
- 交通规则内化
- 常见物体运动预测
-
控制量解码器:直接输出6自由度控制指令:
- 转向角(连续值,精度0.1°)
- 加速度(-3m/s²~3m/s²)
- 横摆角速度
- 档位建议
实测数据显示,这种端到端方案将规划延迟从传统系统的320ms降低到190ms,同时控制精度提升2.8倍。
3. Scaling特性的工程实现
3.1 数据引擎设计
CuriousVLA的scaling能力建立在独特的数据处理流水线上:
-
自动数据挖掘:系统持续从以下渠道收集边缘案例:
- 仿真环境中的对抗性场景
- 真实路测中的干预时刻
- 人类驾驶员异常操作记录
-
多粒度标注:采用三级标注体系:
- 像素级语义分割(150+类别)
- 物体行为标注(加速度、转向意图等)
- 驾驶策略描述(自然语言)
-
课程学习策略:训练分三个阶段推进:
- 基础驾驶技能(2000万帧)
- 复杂交互场景(500万帧)
- 长尾案例专项训练(200万帧)
3.2 模型架构的弹性扩展
团队设计了可灵活伸缩的模型结构:
- 宽度扩展:视觉编码器通道数可从768逐步扩展到3072
- 深度扩展:Transformer层数支持12~48层动态调整
- 模态扩展:预留雷达、V2X等接口的融合能力
这种设计使得模型参数量可以从基础的13B扩展到68B,而无需改变核心架构。测试表明,当模型规模从13B扩大到35B时,其在nuScenes测试集上的mAP指标提升了41%,而推理延迟仅增加23%。
4. 实际部署中的关键挑战与解决方案
4.1 实时性保障
纯自回归架构面临的最大挑战是控制频率的稳定性。CuriousVLA通过以下创新确保实时性能:
-
预测窗口优化:采用非对称时间窗口:
- 感知输入:3秒历史+1秒预测
- 规划输出:0.5秒密集预测(10个控制点)
-
延迟补偿机制:包含:
- 计算耗时预估模型
- 运动状态预测器
- 指令缓冲队列
-
硬件感知推理:针对不同计算平台(如Orin、Thor)自动优化:
- 算子融合策略
- 内存访问模式
- 并行计算粒度
4.2 安全冗余设计
为确保系统可靠性,团队构建了多层防护:
-
在线验证模块:每帧检查:
- 物理可行性(如最大横向加速度)
- 交规符合性(如红灯识别)
- 行为合理性(与周边车辆互动模式)
-
应急接管协议:当检测到以下情况时触发:
- 连续3帧预测不一致
- 关键指标超出安全阈值
- 系统置信度低于0.7
-
影子模式验证:始终保持传统规划器并行运行,用于:
- 结果比对
- 性能基准测试
- 故障场景复现
5. 行业影响与未来方向
CuriousVLA的提出正在改变自动驾驶研发的多个方面:
开发范式转变:
- 从模块化设计转向端到端优化
- 从规则编码转向数据驱动
- 从功能验证转向能力评估
硬件需求演进:
- 计算平台需要更高带宽内存(>1TB/s)
- 传感器时钟同步精度要求提升(μs级)
- 车载通信延迟需要控制在5ms以内
人才结构转型:
- MLLM专家需求激增
- 传统控制工程师需要升级技能
- 数据运营岗位重要性提升
在实际工程落地方面,我们观察到几个值得关注的发展趋势:首先是模型轻量化技术的突破,如通过知识蒸馏将68B模型压缩到8B规模而保持90%性能;其次是跨场景迁移能力的提升,有团队尝试将CuriousVLA架构应用于矿山、港口等特定场景,取得了比专用系统更好的效果;最后是开发工具链的完善,诸如场景生成、自动化测试等配套技术正在快速成熟。
