1. WorldRFT技术框架概览
WorldRFT(World Model with Reinforcement Fine-Tuning)是自动驾驶领域最新提出的端到端决策规划框架,其核心创新在于将潜在世界模型(Latent World Model)与强化学习微调(Reinforcement Fine-Tuning)相结合,解决了传统方法中感知与规划任务耦合导致的优化冲突问题。该框架在nuScenes和NavSim两大基准测试中均实现了当前最优性能(SOTA),其中在nuScenes数据集上的碰撞率降低了83%(从0.30%降至0.05%)。
传统自动驾驶系统通常采用模块化设计,将感知、预测、规划等环节解耦。这种设计虽然便于工程实现,但存在信息损失和误差累积的问题。WorldRFT通过潜在世界模型构建统一的场景表示空间,实现了从原始传感器输入到控制指令的端到端映射。其技术突破主要体现在三个方面:
- 视觉-几何基础模型增强的3D空间理解能力
- 分层规划任务分解引导的表示学习
- 局部感知迭代优化机制
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 潜在世界模型的核心架构
2.1 视觉-几何基础模型
WorldRFT采用多模态Transformer架构处理摄像头输入,其视觉编码器通过自监督预训练获得了对3D场景的几何理解能力。与传统CNN backbone不同,该模型在潜在空间中显式建模了以下几何关系:
- 物体深度分布的概率密度函数
- 路面拓扑结构的曲率变化
- 动态物体的运动学约束
这种表示方式使得模型能够直接从2D图像推断3D场景的几何特性,而无需依赖显式的深度估计模块。实验表明,这种设计在nuScenes数据集上可将3D物体检测的mAP提升12.7%。
2.2 分层规划表示学习
WorldRFT创新性地提出了分层任务分解策略,将自动驾驶规划分解为三个层次:
- 战略层(Strategic):处理全局路径规划和行为决策(如变道、超车)
- 战术层(Tactical):生成局部轨迹候选集
- 操作层(Operational):执行轨迹跟踪和避障
每个层次对应不同的潜在空间表示:
- 战略层使用低维离散编码(约32维)
- 战术层采用中等维度的连续向量(约128维)
- 操作层则保留高维原始特征(约512维)
这种分层表示使得模型可以针
