Skip to main content
QUICK REVIEW

[论文解读] Guided Policy Search Model-based Reinforcement Learning for Urban Autonomous Driving

Zhuo Xu, Jianyu Chen|arXiv (Cornell University)|May 6, 2020
Transportation and Mobility Innovations参考文献 21被引用 8
一句话总结

本文提出一种基于模型的强化学习方法,采用引导策略搜索(Guided Policy Search, GPS)以提升城市自动驾驶中的样本效率与鲁棒性。通过学习环境动态的高斯混合模型(Gaussian Mixture Model, GMM),并利用约束对偶梯度下降优化策略,该方法相较SAC等无模型方法实现了100倍的样本效率提升,成功学习到障碍物避让与变道等复杂任务的策略,而基线方法则未能解决这些问题。

ABSTRACT

In this paper, we continue our prior work on using imitation learning (IL) and model free reinforcement learning (RL) to learn driving policies for autonomous driving in urban scenarios, by introducing a model based RL method to drive the autonomous vehicle in the Carla urban driving simulator. Although IL and model free RL methods have been proved to be capable of solving lots of challenging tasks, including playing video games, robots, and, in our prior work, urban driving, the low sample efficiency of such methods greatly limits their applications on actual autonomous driving. In this work, we developed a model based RL algorithm of guided policy search (GPS) for urban driving tasks. The algorithm iteratively learns a parameterized dynamic model to approximate the complex and interactive driving task, and optimizes the driving policy under the nonlinear approximate dynamic model. As a model based RL approach, when applied in urban autonomous driving, the GPS has the advantages of higher sample efficiency, better interpretability, and greater stability. We provide extensive experiments validating the effectiveness of the proposed method to learn robust driving policy for urban driving in Carla. We also compare the proposed method with other policy search and model free RL baselines, showing 100x better sample efficiency of the GPS based RL method, and also that the GPS based method can learn policies for harder tasks that the baseline methods can hardly learn.

研究动机与目标

  • 解决模仿学习与无模型强化学习在城市自动驾驶中样本效率低下及泛化能力差的问题。
  • 提升高维、交互式城市驾驶环境中策略学习的稳定性与可解释性。
  • 实现对复杂驾驶行为(如障碍物避让与主动变道)的学习,这些行为对基线方法而言极具挑战。
  • 开发一种基于模型的方法,利用学习到的动力学模型实现高效且鲁棒的策略优化。
  • 在仿真环境中展示相较最先进无模型与策略搜索基线方法的优越性能与样本效率。

提出的方法

  • 该方法采用引导策略搜索(GPS)框架,通过高斯混合模型(Gaussian Mixture Model, GMM)迭代学习参数化动态模型,以近似复杂的城市驾驶动态。
  • 应用对偶梯度下降优化求解约束性策略优化问题,引入轨迹变化幅度约束以确保稳定性与收敛性。
  • 系统利用基于GMM的环境模型引导策略学习,相比端到端无模型方法,实现了更好的泛化能力与可解释性。
  • 策略通过高方差的PD控制器进行初始化,以促进探索;而无模型基线方法则采用随机神经网络初始化。
  • 该方法结合基于模型的规划与策略搜索,实现与Carla仿真器的高效交互,加快收敛速度。
  • 该方法在无障碍物与有障碍物的城市驾驶任务上均进行了评估,包括变道与超车任务。

实验结果

研究问题

  • RQ1与无模型方法相比,基于模型的强化学习方法是否能显著提升学习城市自动驾驶策略的样本效率?
  • RQ2基于GPS的方法是否能学习到鲁棒的驾驶策略,以应对主动变道与障碍物避让等复杂任务,而这些任务对无模型与策略搜索基线方法而言极具挑战?
  • RQ3基于GMM的动态模型在可解释性与稳定性方面如何提升策略向真实世界部署的迁移能力?
  • RQ4与无约束或启发式策略搜索方法相比,GPS中的约束性策略优化在收敛性与性能方面提升程度如何?
  • RQ5该基于模型的方法在城市环境中是否能跨多种初始条件与驾驶场景实现良好泛化?

主要发现

  • GPS方法在约1,000次环境交互步骤(100秒驾驶时间)内实现收敛,相较无模型SAC方法(需超过100,000步才收敛)实现了100倍的样本效率提升。
  • GPS策略最终获得约-100,000的奖励,显著优于CEM方法(约-200,000奖励),且CEM方法表现出不稳定的转向与偶发碰撞。
  • GPS方法成功学习到主动变道以超车障碍物车辆等高层决策任务的鲁棒策略,而此前实验中CEM、IL与无模型RL均未能学习到此类策略。
  • GPS策略表现出稳定的车道保持行为与有效的超车能力,而基于CEM的策略则表现出不适的转向与频繁偏离车道或碰撞行为。
  • 在无障碍物与有障碍物的驾驶任务中,基于模型的方法相较CEM与SAC均展现出更快的收敛速度与更高的最终性能。
  • 基于GMM的动态模型提供了可解释且稳定的动力学特性,支持更快的适应与向真实世界部署场景的迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。