1. 项目概述:MAD如何用1/16算力实现顶尖驾驶世界建模
在自动驾驶领域,世界建模一直是个令人头疼的问题。想象一下,你正在教一个刚拿到驾照的新手司机——不仅要让他记住所有交通标志长什么样(外观),更重要的是理解其他车辆和行人会如何移动(运动)。传统方法就像让新手直接上路实操,既危险又低效。而EPFL和法雷奥联合提出的MAD框架,则像先让学员在模拟器上练习基本操作,等掌握运动规律后再实际上路。
这个框架的核心创新在于"运动-外观解耦"(Motion Appearance Decoupling)。就像动画师先画分镜稿再填色一样,MAD先通过"姿态视频"(仅保留车辆/行人骨架轮廓的黑白视频)建模运动关系,再用扩散模型补充外观细节。这种分阶段处理使得:
- 训练效率提升16倍:相比需要2000小时驾驶数据的VISTA模型,MAD仅用167小时数据就达到相当效果
- 人类偏好度领先:在A/B测试中,MAD-LTX版本获得67%的偏好率,超过其他开源方案
- 规划精度更高:5秒轨迹预测误差降低23%,同时保持更自然的运动多样性
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构深度解析
2.1 运动预测模块设计
运动预测模块的核心是处理三类关键输入:
- 文本提示:描述场景的自然语言(如"左转时避让行人")
- 首帧图像:提供初始场景布局
- 自车运动信号:通过独创的"视觉里程计"编码
特别值得注意的是自车运动编码方案。传统方法直接输入速度/转向角数值,但MAD采用了一种更符合视觉认知的方式:在虚拟相机周围放置带纹理的球体和运动粒子。当车辆:
- 转向时:背景纹理会产生旋转变形
- 加速时:粒子会产生运动模糊效果
这种表示不仅更接近人类驾驶员通过挡风玻璃观察到的真实视觉线索,还能让模型自动学习运动参数的隐含关系。实验显示,相比直接输入数值,这种编码方式使运动预测准确率提升19%。
2.2 姿态视频的生成细节
姿态视频使用改进的ControlNet架构生成,关键创新在于:
- 动态骨架表示:
- 车辆:用12个关键点定义立方体轮廓
- 行人:采用17点COCO格式骨架
- 车道线:贝塞尔曲线控制点
- 运动扩散过程:
- 对骨架点坐标添加高斯噪声
- 通过交叉注意力机制融合文本条件
