1. 项目概述
混合动力汽车(HEV)作为传统燃油车向纯电动车过渡的关键产品,其核心挑战在于如何优化发动机与电动机的协同工作。能量管理策略直接决定了整车燃油经济性和排放表现,传统基于规则的控制方法难以应对复杂多变的实际路况。深度强化学习(DRL)通过模拟驾驶环境中的持续学习,为这一经典控制问题提供了全新解决思路。
我在参与某混动平台开发时,发现传统ECU标定策略在NEDC工况下表现良好,但遇到山区道路或拥堵路况时油耗会飙升23%以上。这促使我们尝试将DRL引入能量分配决策,经过6个月的真实道路测试,最终实现了综合工况下8.7%的燃油效率提升。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心算法选型
2.1 DQN与DDPG的对比实验
在初期算法验证阶段,我们同步测试了DQN(Deep Q-Network)和DDPG(Deep Deterministic Policy Gradient)两种典型架构:
| 对比维度 | DQN | DDPG |
|---|---|---|
| 动作空间 | 离散(5档能量分配比例) | 连续(0-100%无级调节) |
| 训练稳定性 | 需要经验回放和固定目标网络 | 对超参数更敏感 |
| 实时性 | 8ms/决策 | 12ms/决策 |
| 最终燃油经济性 | 提升6.2% | 提升8.1% |
实测数据显示,虽然DDPG的训练收敛速度比DQN慢约30%,但其连续动作空间更贴合实际工程需求。特别是在电量保持阶段,DDPG能实现发动机工作点的精确微调。
2.2 状态空间设计要点
构建有效的状态表征是DRL成功应用的关键。我们的状态向量包含12个维度:
- 瞬时车速(km/h)
- 电池SOC(%)
- 需求扭矩(Nm)
- 历史平均能耗(kWh/100km)
- 坡度传感器数据(°)
- 导航预测的路径高程变化
其中坡度数据通过IMU传感器实时获取,与高精地图数据融合后精度可达±0.5°。测试表明,加入高程预测可使长下坡工况的再生制动效率提升15%。
3. 训练环境搭建
3.1 仿真平台构建
基于CarSim/Simulink搭建的数字孪生环境包含:
- 1D发动机模型(精度±3%)
- 锂电池二阶RC等效电路模型
- 传动系统损耗MAP图
- 随机交通流生成模块
特别需要注意的是,电机效率模型必须包含温度影响系数。我们实测发现,当电机温度超过75℃时,其峰值效率会下降5-8个百分点,这在夏季高温测试中尤为明显。
3.2 奖励函数设计
经过多次迭代验证,最终采用的奖励函数包含四个加权项:
code复制R = -0.7×(燃油消耗率)
-0.2×(电池SOC波动)
+0.1×(驾驶平顺性指数)
-0.05×(模式切换次数)
其中驾驶平顺性通过纵向加速度变化率(jerk)来量化,控制在±0.3m/s³以内可获得满分。
4. 实车部署挑战
4.1 边缘计算硬件选型
考虑到车规级芯片的算力限制,我们对比了三种部署方案:
| 硬件平台 | 算力(TOPS) | 功耗(W) | 推理延迟(ms) |
|---|---|---|---|
| NVIDIA Xavier | 30 | 20 | 15 |
| TI TDA4VM | 8 | 12 | 22 |
| 寒武纪MLU220 | 16 | 18 | 18 |
最终选择TDA4VM方案,虽然算力较低,但其ASIL-D功能安全认证和-40℃~105℃的工作温度范围更符合车规要求。通过算子优化,将DRL模型的参数量压缩至1.2MB,满足嵌入式部署需求。
4.2 在线学习机制
基础策略网络部署后,我们设计了增量学习模块:
- 本地缓存异常工况数据(如持续爬坡)
- 当网络连接可用时上传至云端
- 云端训练生成新策略参数
- 通过OTA差分更新至车端
为防止"灾难性遗忘",采用EWC(Elastic Weight Consolidation)算法约束重要参数的更新幅度。实测显示,经过3次在线更新后,山区道路的燃油经济性较初始版本又提升了2.3%。
5. 实测效果分析
在海南汽车试验场进行的对比测试中(环境温度32℃±2℃),新策略展现出显著优势:
| 测试工况 | 传统策略油耗(L/100km) | DRL策略油耗(L/100km) | 提升幅度 |
|---|---|---|---|
| 城市拥堵 | 5.8 | 5.3 | 8.6% |
| 城郊结合 | 4.9 | 4.5 | 8.2% |
| 高速巡航 | 6.2 | 5.8 | 6.5% |
| 山区道路 | 7.5 | 6.7 | 10.7% |
特别值得注意的是,在SOC平衡方面,DRL策略将电量波动范围从传统策略的±12%缩小到±7%,显著延长了电池循环寿命。
6. 工程实践建议
-
数据采集阶段务必包含极端工况(如-20℃冷启动),我们曾因缺少低温数据导致初期策略在北方冬季表现失常
-
奖励函数中建议加入排放惩罚项,满足国六b标准需要额外考虑NOx瞬时排放率
-
模型量化时注意保护小权重参数,某个案例中0.001量级的偏置项被截断后导致决策异常
-
在VCU中保留传统策略作为fallback方案,当DRL模块连续5次输出异常值时自动切换
实际部署中发现,当导航信号丢失时,若仅依赖当前传感器数据,策略性能会下降约20%。这促使我们增加了多源数据融合的冗余设计。
