1. EvoDriveVLA:自动驾驶感知-规划协同蒸馏框架解析
自动驾驶领域正经历着一场由视觉-语言-动作(VLA)模型驱动的技术变革。这类模型不仅能理解复杂的导航指令,还能通过思维链推理解决实际驾驶场景中的决策问题。然而在实际应用中,我们发现当解冻视觉编码器进行微调时,模型会出现两个典型问题:一是预训练阶段获得的通用视觉感知能力会显著退化;二是在长程轨迹预测中,误差累积效应会导致规划结果偏离预期。
针对这些挑战,北大与小鹏汽车联合研发团队提出了一种创新解决方案——EvoDriveVLA框架。这个方案的核心思想是通过协同蒸馏机制,在保持视觉编码器原有感知能力的同时,提升其在特定驾驶场景下的任务适应性。与传统的端到端训练方法不同,EvoDriveVLA采用双路径蒸馏策略:
感知路径:通过自锚定教师模型施加视觉特征约束,防止微调过程中的特征漂移。这里的关键创新是引入了轨迹引导的注意力机制,使模型能够动态调整不同视觉区域的重要性权重。
规划路径:构建具备"未来视觉"的Oracle教师模型,利用特权信息生成高质量的轨迹候选集。特别值得注意的是,该方法通过蒙特卡洛丢弃采样技术,在保证轨迹多样性的同时维持了预测精度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术原理深度剖析
2.1 视觉编码器的退化-适配困境
视觉语言模型在预训练阶段通常采用冻结视觉编码器的策略,这虽然能保持特征的通用性,却限制了其在特定领域的适应能力。当我们解冻视觉编码器进行微调时,会出现一个有趣的矛盾现象:一方面,模型在训练集上的表现会提升,说明具备一定的领域适应能力;另一方面,在保留测试集上的表现往往会下降,这表明通用视觉特征正在退化。
EvoDriveVLA通过构建自锚定教师模型来解决这个问题。具体实现方式是:复制微调前的学生模型视觉编码器作为教师模型,在训练过程中,将教师模型生成的特征作为约束目标。但与简单的特征匹配不同,该方法引入了轨迹引导的注意力机制——根据当前驾驶场景的轨迹预测需求,动态调整不同图像区域的特征约束强度。
2.2 Oracle教师模型的构建奥秘
传统蒸馏方法中,教师模型和学生模型本质上是同质化的,这导致知识传递的效率受限。EvoDriveVLA的创新之处在于构建了一个具备未来感知能力的Oracle教师模型,这个模型可以访问未来3秒的场景图像和车辆状态信息。
