1. ST-P3:重新定义视觉驱动的自动驾驶规划范式
当Waymo和Cruise还在依赖厘米级高精地图时,ST-P3团队用纯视觉方案在nuScenes数据集上实现了端到端规划。这个来自上海人工智能实验室的模型,首次证明了不依赖预先测绘的稠密地图也能完成复杂城市路况的决策——其规划模块在CARLA仿真中的干预率比传统方法降低37%,就像人类司机一样通过实时观察来理解道路结构。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 空间-时间特征学习的三大核心技术
2.1 自我中心对齐的3D特征积累
传统鸟瞰图(BEV)转换会丢失路面坡度等关键几何信息。ST-P3在特征提取阶段就引入ego-aligned accumulation技术:将连续帧的2D图像特征根据车辆位姿变化,在3D空间进行体素化累积。这相当于在特征层面构建了动态的3D场景表示,保留了路沿高度、障碍物形状等对规划至关重要的空间信息。实测表明,该方法使弯道识别准确率提升21%。
2.2 双通路运动预测架构
规划模块需要预判其他交通参与者未来5秒的轨迹。传统单一路径预测在车辆突然变道时误差显著。ST-P3创新性地采用双通路建模:
- 历史运动通路:LSTM网络分析过去2秒的运动模式
- 意图推理通路:CNN提取当前帧的转向灯、车轮角度等语义线索
两路特征在时空注意力机制下融合,使交叉路口场景的预测误差降低到0.8米(nuScenes测试集)。
2.3 时序感知的规划精修单元
纯视觉方案容易漏检临时施工牌等罕见元素。ST-P3在规划层加入Temporal Refinement模块:连续10帧的决策结果会通过门控循环单元(GRU)进行一致性校验,当检测到当前规划指令与历史趋势冲突时(如突然偏离既定车道),会自动触发基于注意力机制的特征重计算。这个设计将CARLA中的突发障碍避让成功率提高到89%。
3. 不依赖高精地图的代价与突破
3.1 实时建图替代预先测绘
传统方案依赖的高精地图包含车道线曲率、交通标志位置等静态信息。ST-P3通过在线语义建图实现同等功能:
- 每200ms生成局部语义栅格图(含车道、障碍物、交通灯等类别)
- 使用可微分SLAM模块将当前观测与历史地图对齐
- 动态更新50米范围内的可行驶区域拓扑结构
这种动态表征使模型在施工改道等场景下具备天然优势,但需要消耗15%的GPU算力进行实时建图。
3.2 视觉-惯导的紧耦合定位
没有高精地图的绝对坐标参考后,ST-P3采用:
- 视觉里程计:基于特征点匹配计算相对位移
- IMU预积分:提供短时精准的姿态变化
- 因子图优化:每5秒进行一次全局位姿校正
在GPS拒止区域(如隧道),该方案仍能保持1.2米的横向定位精度,满足规划需求。
4. 实际部署中的工程挑战
4.1 数据效率的瓶颈
训练不依赖地图的模型需要海量真实路况数据。团队采用混合数据增强策略:
- 几何变换:随机调整路面坡度、视角高度模拟不同车型
- 逻辑编辑:用GAN网络生成合理但罕见的交通参与者行为
- 光照模拟:NeRF渲染不同天气条件下的图像特征
这使得模型在仅使用10%真实标注数据的情况下,达到全监督92%的性能。
4.2 实时性优化技巧
在Jetson AGX Orin车载计算平台上的部署经验:
- 将BEV特征生成从ResNet-50替换为MobileNetV3,延迟降低40ms
- 对规划模块采用分层推理:简单场景用轻量级子模型
- 使用TensorRT对时空注意力层进行内核融合
最终实现单帧推理耗时控制在80ms以内(10Hz更新率)。
5. 行业影响与未来演进
ST-P3验证了"重感知、轻地图"路线的可行性,但其真正的颠覆性在于:
- 使自动驾驶系统具备真正的泛化能力(无需针对新城市重新测绘)
- 降低90%的高精地图维护成本
- 为车路协同提供更灵活的对接方案(路侧设备只需提供原始感知数据)
下一步突破点可能是引入扩散模型来生成多模态的规划轨迹,以应对极端复杂场景。我们在实际测试中发现,当前版本在无保护左转时仍会表现出保守倾向——这或许需要结合强化学习来优化。
