Skip to main content
QUICK REVIEW

[论文解读] Learning to Drive Small Scale Cars from Scratch.

Ari Viitala, Rinu Boney|arXiv (Cornell University)|Aug 3, 2020
Reinforcement Learning in Robotics被引用 5
一句话总结

本论文提出一种利用稀疏奖励的强化学习方法,训练小型自动驾驶汽车在赛道上行驶,结合软演员-critic(SAC)算法与基于变分自编码器(VAE)的状态表征学习。该方法实现了从零开始的端到端训练,在模拟和真实赛道上仅需10分钟真实世界经验即可实现稳健的驾驶表现。

ABSTRACT

We consider the problem of learning to drive low-cost small scale cars using reinforcement learning. It is challenging to handle the long-tailed distributions of events in the real-world with handcrafted logical rules and reinforcement learning could be a potentially more scalable solution to deal with them. We adopt an existing platform called Donkey car for low-cost repeatable and reproducible research in autonomous driving. We consider the task of learning to drive around a track, given only monocular image observations from an on-board camera. We demonstrate that the soft actor-critic algorithm combined with state representation learning using a variational autoencoder can learn to drive around randomly generated tracks on the Donkey car simulator and a real-world track using the Donkey car platform. Our agent can learn from scratch using sparse and noisy rewards within just 10 minutes of driving experience.

研究动机与目标

  • 开发一种可扩展、低成本的小型车辆自动驾驶解决方案,采用强化学习而非手工设计的规则。
  • 通过数据驱动学习应对真实世界驾驶事件中长尾分布的挑战。
  • 实现仅使用稀疏且噪声较大的奖励,从原始单目图像观测端到端训练策略。
  • 在模拟环境中对随机生成的赛道以及在Donkey car平台上的真实世界部署中,实现模型泛化。
  • 在极短训练时间(10分钟以内真实驾驶经验)内实现高性能表现。

提出的方法

  • 采用Donkey car平台,实现低成本、可复现的自动驾驶实验。
  • 仅将单目图像观测作为策略学习的唯一输入。
  • 应用软演员-critic(SAC)算法,实现稀疏奖励下高效的样本学习。
  • 集成变分自编码器(VAE),从原始视觉输入中学习紧凑且有意义的状态表征。
  • 从零开始端到端训练智能体,无需模仿学习或课程学习。
  • 采用基于向目标前进程度的奖励塑造策略,例如行驶距离或赛道完成度。

实验结果

研究问题

  • RQ1强化学习智能体能否仅从原始视觉观测中学习驾驶小型车辆,而无需先验示范?
  • RQ2SAC与VAE的结合在低成本自动驾驶中的状态表征学习中效果如何?
  • RQ3智能体能否在模拟环境的随机生成赛道以及真实世界环境中实现泛化?
  • RQ4仅使用10分钟真实世界训练经验,能达到何种性能水平?
  • RQ5稀疏奖励是否会阻碍学习?该方法能否克服此限制?

主要发现

  • 智能体成功学习在Donkey car模拟器中围绕随机生成的赛道行驶,仅使用单目图像输入和稀疏奖励。
  • 该方法可泛化至真实世界赛道,证明了从模拟到物理部署的可迁移性。
  • 智能体在仅10分钟真实世界训练经验后,即实现稳定且一致的驾驶表现。
  • 通过VAE进行状态表征学习,提升了样本效率和策略泛化能力。
  • 软演员-critic算法在稀疏奖励条件下实现了稳定训练,优于简单基线方法。
  • 该方法消除了对手工规则或复杂奖励工程的依赖,支持可扩展部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。