1. 视觉语言大模型在自动驾驶中的灾难性遗忘现象解析
自动驾驶领域近年来出现了一个明显的技术转向:从传统端到端方案逐步过渡到基于视觉-语言大模型(Vision-Language Models, VLM)的VLA架构。这种转变背后的核心驱动力,是业界对VLM所蕴含的海量世界知识能够解决自动驾驶长尾问题的期待。然而,上海交通大学AutoLab团队的最新研究发现,当这些通用VLM模型在专用自动驾驶数据集上进行微调后,出现了令人担忧的"灾难性遗忘"现象——模型在获得特定驾驶能力的同时,却丧失了原本具备的基础认知能力。
这种现象具体表现为:经过微调的模型在面对原本能够轻松识别的简单场景(如道路上的动物、特殊交通标志等)时,识别准确率显著下降。更令人担忧的是,这种认知能力的退化直接影响了模型的安全性能——在真实道路环境中,漏检一头牛或一个施工标志可能就意味着严重的安全事故。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Fidelity Driving Bench:首个自动驾驶遗忘评测基准
2.1 基准构建方法论
为了系统评估VLA模型在微调过程中的遗忘程度,研究团队构建了Fidelity Driving Bench这一专门评测基准。该基准的构建过程体现了严谨的科研方法论:
首先,团队整合了来自15个不同数据源的驾驶场景数据,形成了包含18万场景、90万组问答对的基础数据池。这种多源数据采集策略确保了基准的广泛代表性。然后,通过基于IDF的稀有度统计和BM25风格归一化算法,从海量数据中筛选出真正具有长尾特性的场景样本。
为确保数据质量,所有候选样本都经过了严格的重新标注和人工审核流程。这一步骤有效消除了不同数据源之间标注风格不一致带来的偏差,保证了评测结果的可靠性。最终形成的测试集包含1000个高难度长尾场景,专门用于评估模型的遗忘程度。
2.2 评测任务与指标设计
Fidelity Driving Bench定义了三种核心评测任务:
- 场景描述(Scene Description):评估模型对驾驶场景的整体理解能力
- 交通问答(Traffic-QA):测试模型对交通规则和驾驶决策的理解
- 关键目标感知(Noteworthy Objects' Perception):专门考察模型对安全关键目标的识别能力
相应地,团队设计了两类核心评估指标:
- NoPR(关键目标感知召回率):量化模型对安全关键目标的识别能力保留程度
- KRR(知识保留率):衡量微调后模型相对于原始基座模型的知识保留比例
这种多维度的评估体系能够全面反映模型在不同层面的遗忘情况,特别是那些直接影响驾驶安全的关键能力退化。
3. 现有方法的局限性分析
通过对现有自动驾驶VLM模型的系统评估,研究团队揭示了几个关键发现:
3.1 数据多样性的重要性
评估结果显示,使用多源数据训练的模型普遍比单一数据源训练的模型表现出更好的知识保留能力。这一发现与具体使用的模型架构无关,表明数据多样性本身就对缓解遗忘具有重要作用。值得注意的是,单纯增加问答数量而不注重场景多样性,反而可能导致模型在长尾测试集上表现更差。
3.2 全量微调的弊端
全量微调(Full Fine-tuning)虽然能提升模型在特定领域任务上的表现,但会显著加剧灾难性遗忘。实验数据显示,经过全量微调的模型,其关键目标感知能力可能比原始基座模型下降超过30%。这种退化直接威胁到自动驾驶系统的安全性。
3.3 LoRA的局限性
低秩适配(LoRA)作为一种轻量级微调方法,虽然在知识保留方面表现优于全量微调,但其在提升驾驶决策能力方面效果有限。在某些情况下,LoRA甚至会导致模型在驾驶任务上的性能退化。这表明简单的参数高效微调方法可能无法满足自动驾驶领域对模型能力的双重需求。
4. Driving Expert Adapter(DEA):创新性解决方案
4.1 整体架构设计
针对现有方法的局限性,研究团队提出了Driving Expert Adapter(DEA)这一创新解决方案。DEA的核心思想是将知识适配从参数空间转向提示空间,通过两个关键组件实现这一目标:
Prompt Adapter(PA):通过可学习的提示词(token)将驾驶任务先验注入模型,而不是直接修改主干网络参数。PA会根据输入问题的语义自动选择最相关的提示embedding,帮助模型在保持基础能力不变的前提下理解特定驾驶任务。
Task-Adaptive Expert Module(TAEM):这是一个动态专家模块,借鉴了混合专家(Mixture of Experts)的思想。它根据场景特征和提示语义,在多个驾驶专家之间进行智能路由和融合,使模型能够针对复杂长尾场景调用最合适的能力模块。
4.2 关键技术细节
DEA的实现包含几个关键技术细节:
在提示适配方面,团队设计了基于注意力机制的提示选择器,能够根据输入场景的语义特征动态组合最相关的提示词。这些提示词在训练过程中与专家模块共同优化,但不会直接影响原始模型参数。
专家路由网络采用轻量级门控结构,仅增加不到1%的计算开销。每个专家实际上是一个小型LoRA模块,专门针对某类驾驶场景进行优化。通过这种设计,DEA能够在保持基础模型参数不变的情况下,实现对不同驾驶场景的精准适配。
5. 实验结果与性能分析
5.1 定量结果
在以Qwen2.5VL-3B为基础模型的实验中,DEA表现出显著优势:
- 场景描述任务提升2.2%
- 交通问答任务提升12.3%
- 知识保留率达到79.0%
与全量微调的ImpromptuVLA-3B相比,DEA将知识保留率从68.4%提升到79.0%,同时保持了优秀的驾驶任务性能。这一结果验证了DEA在平衡专业能力获取和基础知识保留方面的有效性。
5.2 鲁棒性验证
为确保评测结果的可靠性,团队还进行了多角度的补充实验:
LLM Judge分析:使用Qwen3-Max、Gemini-2.5-Pro、GPT-5等多个大模型作为评判者,得到的结论高度一致,排除了特定评委模型带来的偏差。
人工评估:邀请专业标注人员对模型输出进行盲评,结果与自动评测指标相符,进一步验证了基准的可靠性。
5.3 典型场景分析
在夜间路口、复杂施工区等典型长尾场景中,DEA表现出明显的优势。与基线方法相比,DEA能够识别更多关键风险因素,如临时交通标志、特殊天气条件下的行人等。这种能力的保留直接提升了自动驾驶系统在复杂环境中的安全性。
6. 实际应用建议与未来方向
基于这项研究,我们对自动驾驶领域VLA模型的应用提出以下建议:
首先,在模型微调过程中应该更加注重知识保留的评估,不能仅关注特定任务的性能提升。建议开发团队将Fidelity Driving Bench或类似的遗忘评测纳入标准开发流程。
其次,当面临灾难性遗忘问题时,可以考虑采用DEA这类适配器架构。在实际部署中,可以根据具体需求调整专家模块的数量和规模,在计算效率和模型性能之间取得平衡。
未来研究可以从以下几个方向深入:探索更精细化的知识保留策略,研究遗忘与模型架构的关系,以及开发能够自动检测遗忘的监控机制。此外,将这类方法扩展到多模态、多任务学习场景也值得探索。
