[论文解读] ApolloRL: a Reinforcement Learning Platform for Autonomous Driving
ApolloRL 是一个面向自动驾驶的开源端到端强化学习平台,采用可扩展的分布式架构,集成真实道路驾驶数据、仿真、训练与评估。该平台使研究人员能够基于 SOTA 算法(如 PPO 和 SAC)在 300 小时的真实驾驶场景上训练并基准测试强化学习智能体,在复杂交通环境中实现稳定、可复现的性能提升。
We introduce ApolloRL, an open platform for research in reinforcement learning for autonomous driving. The platform provides a complete closed-loop pipeline with training, simulation, and evaluation components. It comes with 300 hours of real-world data in driving scenarios and popular baselines such as Proximal Policy Optimization (PPO) and Soft Actor-Critic (SAC) agents. We elaborate in this paper on the architecture and the environment defined in the platform. In addition, we discuss the performance of the baseline agents in the ApolloRL environment.
研究动机与目标
- 解决在信息不完整、多目标、复杂动作空间及延迟奖励条件下自动驾驶决策的挑战。
- 为真实世界自动驾驶场景中的强化学习研究提供统一、可扩展且可扩展的平台。
- 通过大规模、高保真的真实世界驾驶数据,弥合仿真与真实世界部署之间的差距。
- 通过集成的训练、仿真与评估流水线,支持强化学习算法的快速迭代与评估。
- 通过开放数据、工具及社区协作,激发并加速深度强化学习在自动驾驶领域的研究。
提出的方法
- 该平台采用闭环流水线,整合感知、规划、控制与仿真模块,支持端到端强化学习训练。
- 利用 300 小时的真实世界驾驶数据(50,000 小时用于训练,10,000 小时用于测试)在仿真中生成逼真且多样的交通场景。
- 环境支持自定义观测、动作与稀疏奖励,支持灵活的强化学习算法实现。
- 采用分布式仿真与分布式训练组件,实现跨多个智能体与场景的训练与评估扩展。
- 基线智能体通过专家驾驶员日志的监督学习进行预训练,随后在虚拟环境中通过强化学习进一步优化。
- 平台支持主流连续控制强化学习算法,包括近端策略优化(PPO)与软演员评论家(SAC)。
实验结果
研究问题
- RQ1统一的开源平台是否能显著加速自动驾驶领域深度强化学习的研究?
- RQ2在仿真中基于真实世界衍生场景训练的强化学习智能体,在复杂、长时程驾驶任务中泛化能力如何?
- RQ3与基线方法相比,PPO 与 SAC 智能体在真实世界驾驶场景中的性能提升程度如何?
- RQ4该平台能否支持在多样化、高保真交通环境中的强化学习智能体的可扩展、可复现的训练与评估?
- RQ5在自动驾驶决策中,结合监督预训练与强化微调的潜力有多大?
主要发现
- ApolloRL 平台成功实现了强化学习智能体的稳定、可复现训练,表现为训练步数增加过程中累积奖励曲线持续改善。
- 采用 PPO 和 SAC 训练的基线智能体在复杂驾驶场景中实现了可测量的性能提升,部分表现优于真实道路自动驾驶系统中的基线。
- 平台支持在数十个多样化自动驾驶场景(ADS)上训练智能体,其中大部分场景在每场景 20–30 秒内即达成训练目标。
- 将真实世界数据整合到仿真中,实现了高保真场景生成,支持真实可靠的智能体训练与评估。
- 平台的分布式架构可高效扩展仿真与训练,支持未来扩展至数千个场景。
- 平台具备可扩展性,支持用户自定义算法、超参数、模型与探索策略,具有广泛的科研适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。