Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning based Control of Imitative Policies for Near-Accident Driving

Zhangjie Cao, Erdem Bıyık|arXiv (Cornell University)|Jul 1, 2020
Autonomous Vehicle Technology and Safety参考文献 52被引用 5
一句话总结

本文提出 H-ReIL,一种分层强化学习与模仿学习框架,通过模仿学习实现低层次驾驶模式(如激进、谨慎)的控制,结合强化学习实现高层次的模式切换,从而在近事故驾驶场景中实现安全高效的导航。该方法在安全性和效率方面表现优异,用户研究显示其相对于基线方法具有统计上显著的偏好(p < 0.005)。

ABSTRACT

Autonomous driving has achieved significant progress in recent years, but autonomous cars are still unable to tackle high-risk situations where a potential accident is likely. In such near-accident scenarios, even a minor change in the vehicle's actions may result in drastically different consequences. To avoid unsafe actions in near-accident scenarios, we need to fully explore the environment. However, reinforcement learning (RL) and imitation learning (IL), two widely-used policy learning methods, cannot model rapid phase transitions and are not scalable to fully cover all the states. To address driving in near-accident scenarios, we propose a hierarchical reinforcement and imitation learning (H-ReIL) approach that consists of low-level policies learned by IL for discrete driving modes, and a high-level policy learned by RL that switches between different driving modes. Our approach exploits the advantages of both IL and RL by integrating them into a unified learning framework. Experimental results and user studies suggest our approach can achieve higher efficiency and safety compared to other methods. Analyses of the policies demonstrate our high-level policy appropriately switches between different low-level policies in near-accident driving situations.

研究动机与目标

  • 解决在高风险、近事故驾驶场景中安全高效决策的挑战,此类场景中微小的状态变化会引发剧烈的动作转变。
  • 克服纯强化学习与模仿学习在处理驾驶策略中非平滑、快速的相变时的局限性。
  • 开发一种可扩展的框架,利用专家示范实现特定驾驶风格的学习,同时通过强化学习实现动态模式切换。
  • 在复杂驾驶场景(如无保护左转和并线)中实现安全与效率之间的平衡权衡。
  • 通过仿真和真实近事故环境中的用户评估,证明分层策略学习的有效性。

提出的方法

  • 基于驾驶行为在安全与效率之间的权衡,定义离散的驾驶模式(如激进、谨慎)。
  • 通过条件模仿学习训练低层次策略,每个策略分支专门针对一种驾驶模式,并使用专家示范进行训练。
  • 实现一个高层次的强化学习策略,根据当前环境状态选择最优的低层次策略。
  • 使用共享特征提取器与模式特定的动作分支,其中高层次动作 $a_h$ 选择激活的低层次策略。
  • 在仿真环境(CARLA)中训练高层次策略,采用密集奖励以提升安全性和效率,实现自适应的模式切换。
  • 将分层策略整合到统一框架中,支持在近事故场景中端到端的训练与部署。

实验结果

研究问题

  • RQ1分层强化学习-模仿学习框架是否能有效建模近事故驾驶场景中因微小状态变化而需剧烈动作转变的快速相变?
  • RQ2将模仿学习用于特定驾驶模式、强化学习用于模式切换,是否相比纯模仿学习或强化学习能显著提升安全性和效率?
  • RQ3高层次策略能否根据动态环境线索(如对向车辆速度)正确地在不同模式间切换?
  • RQ4在时间约束下,H-ReIL 相较于基线方法(如 IL、Random、Aggressive)在碰撞规避和任务完成率方面表现如何?
  • RQ5在安全性和驾驶质量方面,人类用户在多大程度上偏好 H-ReIL 而非其他驾驶策略?

主要发现

  • 在 49 名受试者的用户研究中,H-ReIL 在 7 点李克特量表上的偏好具有统计显著性,p 值小于 0.005。
  • 在停车车和错误方向场景中,H-ReIL 分别在 [35,75] 和 [25,45] 个时间步附近表现出明显的相变,当碰撞风险增加时切换至谨慎模式。
  • H-ReIL 保持中等速度——高于 IL 的温和谨慎策略,但低于激进策略——同时碰撞率与 IL 相当,但整体效率更优。
  • 在交叉交通场景中,H-ReIL 在不同时间限制下均保持较高或相当的任务完成率,相较于 IL 和 Random 表现更优,且在较长时限下显著优于激进基线。
  • 策略可视化证实,H-ReIL 在高风险区域正确选择了谨慎模式,在安全区域选择了激进模式,展现了上下文感知的切换能力。
  • 低层次的模仿学习策略在每种模式下仅需少量专家示范即可成功训练,且高层次的强化学习策略能有效协调模式选择,无需完全覆盖环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。