1. 合作背景与战略意义
当国产GPU遇上自动驾驶头部企业,这场合作注定将在中国AI产业版图上留下浓墨重彩的一笔。摩尔线程作为国内全功能GPU领域的领跑者,其MTT S3000计算卡单卡即可提供15TFLOPS的FP32算力,而小马智行已在全球累计完成超过2000万公里的自动驾驶测试里程。双方此次联手,瞄准的正是L4级自动驾驶规模化落地中最关键的算力瓶颈问题。
在自动驾驶技术栈中,感知模块的BEV(Bird's Eye View)算法每帧数据处理需要约50TOPS算力,而预测规划模块的Transformer模型推理则需消耗30-100TOPS不等。传统方案依赖进口GPU,不仅面临供应链风险,还存在硬件利用率低下的痛点。实测数据显示,某些国外GPU在运行典型自动驾驶算法时,实际利用率往往不足60%,存在严重的算力浪费。
关键数据:小马智行第六代自动驾驶系统采用7颗200TOPS算力芯片,整套系统功耗控制在1500W以内,而摩尔线程最新发布的KUAE智算中心解决方案可实现单机柜40PFLOPS算力密度
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术协同创新点解析
2.1 异构计算架构优化
摩尔线程为其MTT GPU开发了独特的MUSA异构计算架构,针对自动驾驶特有的计算模式进行了深度优化。在典型的多任务处理场景下(如同时运行感知、预测、规划模块),相比传统架构可实现30%的能效提升。具体体现在:
- 专用张量核心针对BEV特征提取优化,处理速度提升2.3倍
- 内存子系统采用智能数据预取技术,减少40%的DDR带宽占用
- 任务调度器支持微秒级上下文切换,满足自动驾驶实时性要求
2.2 数据闭环加速
双方合作构建了从仿真到实车的完整数据闭环系统:
- 在云端使用摩尔线程GPU集群进行大规模并行仿真,单日可生成百万公里级测试场景
- 边缘计算节点部署量化后的模型,通过OTA持续更新算法
- 车载计算平台实时处理传感器数据,关键场景自动触发数据回传
实测表明,这种架构使得算法迭代周期从传统的2周缩短至3天,且硬件资源利用率稳定在85%以上。
3. 自动驾驶全栈技术突破
3.1 感知层创新
合作方案采用了新一代"激光雷达+视觉"融合感知架构:
- 点云处理采用稀疏卷积网络,延迟降低至8ms/帧
- 视觉分支引入改进的YOLOv6模型,准确率提升5.2%
- 特征融合模块使用自研的Attention机制,误检率下降30%
3.2 预测规划突破
在轨迹预测方面,双方联合研发了基于扩散模型(Diffusion Model)的预测算法:
- 支持同时生成多条概率性轨迹
- 处理时延控制在50ms以内
- 在交叉路口场景预测准确率可达92%
规划模块则创新性地采用分层强化学习架构:
- 高层规划器负责全局路径生成
- 底层控制器处理紧急避障
- 两者通过价值网络实现协同优化
4. 产业化落地路径
4.1 车规级硬件方案
合作推出的车载计算平台具备以下特性:
- 算力配置灵活,支持200-1000TOPS算力扩展
- 功耗控制在15W/TFLOPS以内
- 通过ASIL-D功能安全认证
- 支持-40℃至85℃宽温工作
4.2 规模化部署策略
分三个阶段推进商业化:
- 2023-2024年:在Robotaxi车队部署1000套系统
- 2025年:前装量产乘用车项目落地
- 2026年后:向物流、环卫等商用场景扩展
5. 开发者生态构建
为降低技术门槛,双方共同发布了:
- PonyAI+MTT联合开发套件
- 自动驾驶专用模型库(包含50+预训练模型)
- 全栈工具链(从数据标注到模型部署)
- 仿真测试云平台(支持万级并发测试)
典型开发者案例显示,使用该套件可使:
- 算法开发效率提升60%
- 硬件调试时间缩短75%
- 系统集成成本降低40%
6. 实测性能数据
在标准化测试场景下(Urban Driving @ Shanghai):
- 感知延迟:<50ms
- 规划响应时间:<100ms
- 系统功耗:<800W
- 极端天气识别率:>90%
与上一代方案相比:
- 算力利用率提升35%
- 每公里计算能耗降低28%
- 系统成本下降40%
7. 行业影响与未来展望
这次合作标志着国产AI算力在自动驾驶领域实现三大突破:
- 关键技术自主可控:从芯片到算法的完整国产化方案
- 性能价格比优势:单位算力成本仅为国际竞品的60%
- 场景适配能力:针对中国复杂路况深度优化
随着合作深入,双方还将共同探索:
- 车路云协同计算架构
- 大模型在自动驾驶中的应用
- 新型传感器融合方案
- 端到端自动驾驶系统
在自动驾驶即将迎来爆发式增长的前夜,这种"芯片+算法"的深度协同模式,或许正在为行业树立新的技术标杆。
