1. 项目概述
Raw2Drive是上海交通大学、复旦大学等团队联合提出的一种基于双流模型的强化学习端到端自动驾驶方案。这项研究突破了传统模仿学习在自动驾驶领域的局限性,通过创新的双流架构和引导机制,首次实现了仅依赖原始传感器输入的端到端强化学习自动驾驶系统。
在自动驾驶领域,端到端(E2E)方法因其简洁性和潜在的高性能而备受关注。传统方法通常将感知、决策和控制模块分开设计,而端到端方法则试图用一个统一的模型直接从传感器输入映射到驾驶决策。这种方法的优势在于避免了模块化设计中的信息损失和误差累积,但也面临着训练难度大、可解释性差等挑战。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术原理
2.1 双流模型架构设计
Raw2Drive的核心创新在于其双流模型架构,包含特权流(Privileged Stream)和原始传感器流(Raw Sensor Stream)两个并行分支:
- 特权流:使用BEV语义掩码等结构化信息作为输入,训练特权世界模型和对应策略
- 原始传感器流:仅使用多视角摄像头图像等原始传感器数据作为输入
这两个流通过精心设计的引导机制保持同步训练,最终推理阶段仅需原始传感器流即可完成自动驾驶决策。
关键设计思路:特权流提供高质量的先验知识和监督信号,原始传感器流则专注于从原始数据中学习有效表征。这种设计既保留了强化学习的优势,又解决了直接从原始数据训练的困难。
2.2 引导机制详解
引导机制是确保双流模型有效协同的关键,包含两个核心组件:
-
滚动引导(Rollout Guidance):
- 时空对齐:确保BEV特征在空间和时间维度上的一致性
- 抽象状态对齐:通过MSE和KL散度约束双流模型的确定性状态和随机状态
- 随机消除策略:消除采样差异导致的累计误差
-
头部引导(Head Guidance):
- 利用特权世界模型输出的奖励和继续标志作为监督信号
- 避免直接使用原始传感器数据训练这些头部导致的收敛问题
3. 实现细节与训练流程
3.1 模型组件设计
Raw2Drive的模型架构包含以下关键组件:
| 组件类型 | 特权流实现 | 原始传感器流实现 |
|---|
