Skip to main content
QUICK REVIEW

[论文解读] Implementing a Cloud Platform for Autonomous Driving

Shaoshan Liu, Jie Tang|arXiv (Cornell University)|Apr 10, 2017
Scientific Computing and Data Management参考文献 3被引用 11
一句话总结

本文提出了一种统一的云平台基础设施,用于自动驾驶,整合了分布式计算、存储和异构加速器,以支持仿真、深度学习训练和高清地图生成等关键工作负载。作者展示了可扩展、生产就绪的系统,通过模块化、云原生设计和优化的资源编排,实现了自动驾驶车辆开发的高效端到端支持。

ABSTRACT

Autonomous driving clouds provide essential services to support autonomous vehicles. Today these services include but not limited to distributed simulation tests for new algorithm deployment, offline deep learning model training, and High-Definition (HD) map generation. These services require infrastructure support including distributed computing, distributed storage, as well as heterogeneous computing. In this paper, we present the details of how we implement a unified autonomous driving cloud infrastructure, and how we support these services on top of this infrastructure.

研究动机与目标

  • 设计并实现一种专为自动驾驶工作负载定制的统一云基础设施。
  • 支持多样化、计算密集型任务,如分布式仿真、离线深度学习训练和高清地图生成。
  • 将异构计算(如GPU、TPU)与分布式存储及可扩展编排技术集成。
  • 在云环境中实现自动驾驶软件栈的高效、可靠和可扩展部署。
  • 提供支持自动驾驶系统开发全生命周期的生产级平台。

提出的方法

  • 该平台基于微服务架构的云基础设施构建,包含用于仿真、训练和地图处理的模块化组件。
  • 利用分布式计算框架,将仿真和训练任务在多台机器的集群上横向扩展。
  • 通过动态资源调度器编排异构加速器(GPU、TPU),以加速深度学习工作负载。
  • 使用分布式存储系统管理大规模数据集,包括传感器数据和高清地图资产。
  • 系统采用容器化和编排技术(如Kubernetes类似模式)实现工作负载隔离和可移植性。
  • 集中式控制平面协调平台范围内的作业调度、监控和故障恢复。

实验结果

研究问题

  • RQ1如何使统一云平台高效支持自动驾驶开发的多样化且高要求的工作负载?
  • RQ2哪些架构模式能够实现分布式计算、存储和异构加速器的有效集成?
  • RQ3如何在单一云基础设施上协同部署和编排仿真、训练和高清地图生成?
  • RQ4在生产级自动驾驶云中可实现哪些性能和可扩展性保障?
  • RQ5如何在保持低延迟作业执行的同时,优化异构硬件上的资源利用率?

主要发现

  • 该平台成功支持端到端的自动驾驶开发流水线,包括仿真、模型训练和高清地图生成。
  • 异构加速器的集成显著缩短了用于感知和规划的深度学习模型的训练时间。
  • 分布式仿真工作负载可在数百个节点上有效扩展,支持对新算法的高保真度测试。
  • 通过智能作业调度和基于容器化的工作负载隔离,系统实现了高资源利用率。
  • 平台在作业提交和恢复方面表现出低延迟,这对自动驾驶系统迭代开发周期至关重要。
  • 模块化、云原生的设计具备可扩展性,可支持未来工作负载,如实时数据处理和空中升级。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。