1. 轻舟智航L2/L4智驾方案技术解析
最近轻舟智航发布了基于单征程6M芯片的城市NOA方案,并已在理想L系列智能焕新版上实现上车。作为自动驾驶领域的技术从业者,我对这套方案进行了深入研究,发现其在算力受限条件下实现了一段式端到端+强化学习的创新架构,确实有不少值得探讨的技术亮点。
1.1 方案整体架构概述
轻舟的这套智驾方案采用了"一段式端到端+强化学习"的架构设计,在单颗征程6M(128TOPS算力)上实现了城市NOA功能。从技术实现来看,这套方案的核心创新点在于:
- 多传感器时序BEV融合
- 统一的世界-状态隐编码器
- Flow-Matching Planner轨迹规划
- Safe RL强化学习优化
这种架构设计在保证性能的同时,很好地平衡了算力限制与功能需求之间的矛盾。下面我将详细拆解每个技术模块的实现原理和设计考量。
1.2 传感器输入与BEV融合
系统的输入部分包括:
- 时序图像数据(多摄像头)
- 激光雷达点云
- SD导航信息
- 自车位姿信息
这些数据经过多传感器时序BEV融合后,会生成全局的BEV(鸟瞰图)表征。BEV融合是目前主流的感知方案,其优势在于:
- 统一了不同传感器的坐标系
- 保留了空间几何关系
- 便于后续任务头解码
在实际工程实现中,时序BEV融合面临的主要挑战是:
- 不同传感器的时间同步
- 运动补偿的准确性
- 特征对齐的精度
提示:BEV融合的质量直接影响后续所有模块的性能,因此在工程实现时需要特别关注传感器标定和时间同步的精度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术模块深度解析
2.1 多任务解码头设计
BEV特征会输入到多个任务解码头,分别输出:
- 道路拓扑结构
- OCC(占据栅格)特征
- 交通元素特征
- Agent(动态物体)特征
这种多任务学习的设计有以下优势:
- 共享底层特征,减少计算冗余
- 各任务间相互促进,提升整体性能
- 统一特征空间,便于后续模块使用
在实际应用中,我们发现多任务学习需要注意:
- 任务间损失权重的平衡
- 梯度冲突的处理
- 不同任务对特征需求的差异
2.2 世界-状态隐编码器
这是轻舟方案的一个创新点,它将:
- BEV表征
- Agent特征
- OCC特征
- 静态环境特征
- 交通信号特征
统一编码到一个潜在空间。这种设计的思想来源于世界模型(World Model)的概念,旨在构建一个对驾驶环境的统一理解。
技术实现上,这个编码器需要:
- 处理多模态输入
- 保留时空关系
- 提取高层语义
- 支持后续规划决策
2.3 Flow-Matching Planner
轻舟采用了Flow-Matching技术进行轨迹规划,这是Diffusion Planner的改进版本。两者的主要区别在于:
| 特性 | Diffusion Planner | Flow-Matching Planner |
|---|---|---|
| 理论基础 | 扩散模型 | 连续归一化流 |
| 训练稳定性 | 相对较差 | 更好 |
| 采样效率 | 较低 | 较高 |
| 模式覆盖 | 全面但慢 | 快速且全面 |
Flow-Matching的优势在于:
- 更快的收敛速度
- 更高的采样效率
- 更好的训练稳定性
在实际应用中,我们发现Flow-Matching特别适合:
- 实时性要求高的场景
- 算力受限的平台
- 多模态输出的需求
3. 强化学习与安全机制
3.1 Safe RL优化
轻舟在轨迹规划后使用了Safe RL(安全强化学习)进行优化,这是整套方案的"安全兜底"机制。其核心思想是:
- 先用Flow-Matching生成候选轨迹
- 再用强化学习基于安全规则进行微调
- 最终输出符合安全约束的轨迹
这种两阶段设计的好处是:
- 保留端到端学习的优势
- 通过规则保证基本安全性
- 可针对特定场景进行优化
工程实现中的关键点包括:
- 安全规则的制定
- 奖励函数的设计
- 策略更新的频率
3.2 实际场景表现
从轻舟发布的demo来看,这套方案在以下场景表现优异:
- 严重错位道路
- 考验静态环境感知精度
- 依赖高精地图与感知的融合
- 复杂路口无保护左转
- 需要准确预测他车意图
- 要求规划算法具有多模态能力
- 密集车流中的变道
- 测试交互能力
- 验证轨迹平滑性
这些场景的成功处理,证明了方案在感知、预测、规划各环节的有效性。
4. 下一代架构:VLA与世界模型融合
轻舟还公布了下一代自动驾驶架构,将VLA(Vision-Language-Action)与世界模型融合到端到端系统中。这套架构包含五个关键部分:
4.1 增强的输入模块
除了常规传感器输入,新增:
- 语音指令(cmd)
- 环境文本信息
- 交互指令
这使得系统能够理解并响应更复杂的用户需求。
4.2 Transformer Decoder模块
新增的Transformer Decoder用于处理:
- 复杂文本信息
- 困难场景描述
- 车端语言指令
- CoT(思维链)中间表示
这个模块是实现语言理解与推理的核心。
4.3 多模态世界解码器
这是一个生成式模型,具备:
- 未来世界动态演化能力
- 多模态输出能力
- 与语言推理的强对齐
注意:多模态世界解码器与语言推理的强对齐是关键,否则容易产生"幻觉"问题,导致决策失误。
4.4 RA安全机制
针对L4级自动驾驶,轻舟提出了RA(Responsibility-Aware)机制,从系统层面保障安全。这包括:
- 责任敏感安全模型
- 故障检测与处理
- 最小风险策略
5. 技术挑战与工程实践心得
在实际工程实现中,我们总结了以下经验:
5.1 算力受限下的优化技巧
在128TOPS的算力限制下实现复杂功能,需要:
- 模型剪枝与量化
- 算子融合优化
- 内存访问优化
- 流水线设计
特别是BEV转换和Flow-Matching这些计算密集型模块,需要精细优化。
5.2 多传感器时序对齐
实现高精度的多传感器时序融合,关键点包括:
- 硬件同步信号设计
- 软件时间戳管理
- 运动补偿算法
- 外参在线标定
5.3 世界模型的实践挑战
构建有效的世界模型面临:
- 长尾场景覆盖
- 未来预测不确定性
- 多模态对齐
- 实时性要求
我们在实践中发现,适当引入归纳偏置和物理约束可以显著提升世界模型的实用性。
6. 行业技术路线思考
从技术发展来看,自动驾驶正在经历从模块化到端到端的演进。轻舟的方案代表了一种折中思路:
- 保留部分模块化设计(如BEV感知)
- 关键环节采用端到端学习(如规划)
- 用强化学习保证安全性
这种架构既利用了深度学习的强大表征能力,又通过先验知识和规则约束保障了安全性,在现阶段是较为务实的选择。
关于VLA与世界模型的融合,我认为这代表了未来的一个重要方向,但要真正落地还需要解决:
- 语言理解的可靠性
- 多模态对齐的稳定性
- 长尾场景的泛化性
- 系统的可解释性
在实际项目中,我们发现端到端系统的调试和问题定位确实比传统模块化系统更具挑战性,这需要开发新的工具链和方法论。
