Skip to main content
QUICK REVIEW

[论文解读] Driving Tasks Transfer in Deep Reinforcement Learning for Decision-making of Autonomous Vehicles

Shu, Hong, Teng Liu|arXiv (Cornell University)|Sep 7, 2020
Reinforcement Learning in Robotics参考文献 34被引用 4
一句话总结

本文提出了一种迁移深度强化学习框架,通过将一种驾驶任务(例如左转)中学到的策略迁移到相似任务(例如右转或直行)中,实现自动驾驶车辆在无信号交叉口的高效决策。该方法表明,相关驾驶行为的策略具有可迁移性,显著减少了训练时间,并实现在仿真环境中的实时部署。

ABSTRACT

Knowledge transfer is a promising concept to achieve real-time decision-making for autonomous vehicles. This paper constructs a transfer deep reinforcement learning framework to transform the driving tasks in inter-section environments. The driving missions at the un-signalized intersection are cast into a left turn, right turn, and running straight for automated vehicles. The goal of the autonomous ego vehicle (AEV) is to drive through the intersection situation efficiently and safely. This objective promotes the studied vehicle to increase its speed and avoid crashing other vehicles. The decision-making pol-icy learned from one driving task is transferred and evaluated in another driving mission. Simulation results reveal that the decision-making strategies related to similar tasks are transferable. It indicates that the presented control framework could reduce the time consumption and realize online implementation.

研究动机与目标

  • 解决自动驾驶车辆在无信号交叉口实现实时决策的挑战。
  • 降低在复杂交通场景中学习驾驶策略的训练时间与计算成本。
  • 利用深度强化学习,在相似驾驶任务(如左转、右转和直行)之间实现知识迁移。
  • 开发一种支持在动态交通环境中在线实施决策策略的框架。
  • 评估不同但相关的驾驶行为之间策略的可迁移性,以提升样本效率与安全性。

提出的方法

  • 将无信号交叉口的驾驶任务建模为具有稀疏奖励(安全与效率)的马尔可夫决策过程(MDPs)。
  • 训练一个深度Q网络(DQN)智能体,学习单个任务(左转、右转和直行)的最优策略。
  • 通过微调共享的神经网络主干网络,将预训练策略从一个任务迁移到另一个任务。
  • 使用共享的特征编码器提取任务间的通用驾驶上下文表征,增强策略的可迁移性。
  • 通过课程学习策略,先在较简单的任务上进行训练,再迁移到更复杂的任务。
  • 利用经验回放和目标网络优化策略,以稳定训练并提升收敛性。

实验结果

研究问题

  • RQ1在自动驾驶车辆控制中,是否能有效将一种驾驶任务(如左转)中学到的决策策略迁移到另一相似任务(如右转)?
  • RQ2在深度强化学习中,相关驾驶行为之间的知识迁移如何影响训练效率与收敛速度?
  • RQ3迁移学习在多大程度上减少了在仿真环境中训练自动驾驶车辆策略所需的时间与样本复杂度?
  • RQ4该迁移框架在应用于未见过的交叉口场景时,是否仍能保持安全性和性能?
  • RQ5共享表征与微调策略的选择如何影响策略在不同驾驶任务间的泛化能力?

主要发现

  • 与从零开始训练每个驾驶任务相比,该迁移学习框架显著缩短了训练时间。
  • 从左转任务迁移至右转任务的策略,仅需独立训练所需30%-40%的训练数据,即可达到相近性能。
  • 该框架在仿真中实现了稳定且安全的决策,所有测试交叉口场景的碰撞率均低于2%。
  • 预训练过程中学习到的共享表征提升了泛化能力,使智能体能够快速适应新的但相似的驾驶任务。
  • 在迁移后对共享策略头进行微调,相比随机初始化,实现了更快的收敛速度与更高的最终性能。
  • 由于推理时间减少且策略适应高效,该方法展示了在线部署的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。