Skip to main content
QUICK REVIEW

[论文解读] CARLA Real Traffic Scenarios -- novel training ground and benchmark for autonomous driving

Błażej Osiński, Piotr Miłoś|arXiv (Cornell University)|Dec 16, 2020
Autonomous Vehicle Technology and Safety参考文献 48被引用 12
一句话总结

本文提出了CARLA真实交通场景(CRTS),这是一个大规模、开源的基准,利用真实世界交通数据在CARLA模拟器中模拟高速公路变道和环岛导航。该基准支持使用强化学习训练和评估自动驾驶智能体,表明密集奖励设计与鸟瞰图观测可实现更优的泛化能力和成功率(在openDD上达到91.4%),优于稀疏奖励或无故障惩罚方案。

ABSTRACT

This work introduces interactive traffic scenarios in the CARLA simulator, which are based on real-world traffic. We concentrate on tactical tasks lasting several seconds, which are especially challenging for current control methods. The CARLA Real Traffic Scenarios (CRTS) is intended to be a training and testing ground for autonomous driving systems. To this end, we open-source the code under a permissive license and present a set of baseline policies. CRTS combines the realism of traffic scenarios and the flexibility of simulation. We use it to train agents using a reinforcement learning algorithm. We show how to obtain competitive polices and evaluate experimentally how observation types and reward schemes affect the training process and the resulting agent's behavior.

研究动机与目标

  • 通过将场景基于真实世界交通数据,减少自动驾驶模拟中的现实差距。
  • 提供一个可扩展、开源的基准,用于在强化学习框架下训练和评估自动驾驶策略。
  • 研究观测模态与奖励设计对战术驾驶任务中策略性能与泛化能力的影响。
  • 支持对多样化方法的评估,包括端到端学习、基于规则的系统以及经典规划方法。
  • 作为算法部署前的可靠测试平台,用于算法验证。

提出的方法

  • CRTS从openDD和NGSIM数据集中提取超过60,000个真实世界交通场景,并将其映射到CARLA中,实现真实物理与交通规则。
  • 模拟器支持多种观测模式:鸟瞰图、摄像头与LiDAR,支持多模态策略训练。
  • 采用密集奖励函数,整合进度、安全与规则符合性指标,并对稀疏奖励与无故障惩罚变体进行消融研究。
  • 使用基于DQN的强化学习算法,结合经验回放与目标网络,在场景的训练/测试划分上进行训练。
  • 开发了自定义Python包用于生成鸟瞰图观测,便于迁移到无关项目。
  • 通过在未见测试场景上测试策略,评估泛化能力,以不同输入模态与奖励方案下的成功率作为衡量指标。

实验结果

研究问题

  • RQ1观测模态的选择(鸟瞰图、视觉、LiDAR)如何影响战术驾驶任务中的策略性能与泛化能力?
  • RQ2不同的奖励设计策略——密集奖励、稀疏奖励与无故障惩罚——如何影响训练收敛性与最终成功率?
  • RQ3在CRTS上训练的策略在未见场景中的泛化程度如何?哪些因素影响这种泛化能力?
  • RQ4端到端强化学习智能体能否学习到安全且有效的驾驶行为,使其与真实世界驾驶模式相似?
  • RQ5在支持可靠部署前测试方面,CRTS的保真度相较于其他模拟器有何优势?

主要发现

  • 密集奖励方案在测试场景中取得了最高成功率,于openDD上达到91.4%,在NGSIM上达到82.8%,优于稀疏奖励与无故障惩罚变体。
  • 与视觉输入相比,鸟瞰图输入表现更优,尤其在高速公路变道任务中,帧堆叠提升了速度估计能力。
  • 帧堆叠在NGSIM上提升了性能,但在openDD上反而降低了性能,表明运动线索在环岛场景中作用较小。
  • 采用密集奖励训练的策略泛化能力更强,行为更一致;而稀疏奖励训练收敛更慢,测试性能更低。
  • 定性分析显示,训练后的智能体常行驶过快,未能适当前置减速,表明奖励函数中缺乏舒适性与规则遵循的激励。
  • 尽管成功率较高,部分可避免的碰撞仍发生,尤其在前视实验中因未观测到后方车辆而引发,凸显感知与安全方面的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。