[论文解读] Improved Deep Reinforcement Learning with Expert Demonstrations for Urban Autonomous Driving
本文提出了一种基于软演员-critic(SAC)的强化学习行为克隆(RLfD)框架,通过联合优化奖励最大化与专家行为模仿,实现城市自动驾驶中的高效学习。通过引入自适应优先经验回放机制,平衡智能体自我探索与专家示范数据的使用,该方法实现了更快的收敛速度与更优的性能表现——在模拟环岛场景中达到90%的成功率与8%的碰撞率,优于当前最先进的强化学习与模仿学习基线方法。
Learning-based approaches, such as reinforcement learning (RL) and imitation learning (IL), have indicated superiority over rule-based approaches in complex urban autonomous driving environments, showing great potential to make intelligent decisions. However, current RL and IL approaches still have their own drawbacks, such as low data efficiency for RL and poor generalization capability for IL. In light of this, this paper proposes a novel learning-based method that combines deep reinforcement learning and imitation learning from expert demonstrations, which is applied to longitudinal vehicle motion control in autonomous driving scenarios. Our proposed method employs the soft actor-critic and modifies the learning process of the policy network to incorporate both the goals of maximizing reward and imitating the expert. Moreover, an adaptive prioritized experience replay is designed to sample experience from both the agent's self-exploration and expert demonstration, in order to improve sample efficiency. The proposed method is validated in a simulated urban roundabout scenario and compared with various prevailing RL and IL baselines. The results manifest that the proposed method has a faster training speed, as well as better performance in navigating safely and time-efficiently.
研究动机与目标
- 解决深度强化学习(DRL)在复杂城市驾驶场景中数据效率低,以及模仿学习(IL)泛化能力差的问题。
- 通过引入专家示范数据,提升DRL的样本效率与学习速度。
- 通过统一优化奖励最大化与专家模仿,提升自主纵向控制策略的性能与安全性。
- 设计一种自适应经验回放机制,动态平衡自我探索与专家数据采样。
- 在高保真度模拟城市环岛环境中,针对多样化交通条件验证所提方法的有效性。
提出的方法
- 该方法采用改进的策略网络更新机制的软演员-critic(SAC)框架,结合Q函数最大化与专家动作模仿。
- 在策略更新中引入模仿损失,使智能体行为与专家示范对齐,确保性能下限。
- 设计自适应优先经验回放(PER)机制,动态调整智能体轨迹与专家示范数据的采样比例。
- 经验回放缓冲区同时存储自收集的转移样本与专家轨迹,采样权重根据训练进度与数据质量动态调整。
- 将车辆控制分解为横向(纯追踪)与纵向(通过所提RLfD方法学习)两部分,以降低复杂度。
- 在CARLA模拟器中,基于具有动态交通的现实城市环岛场景对框架进行训练与测试。
实验结果
研究问题
- RQ1将深度强化学习与专家示范相结合,是否能提升自动驾驶中的样本效率与训练速度?
- RQ2在复杂城市场景中,联合优化奖励最大化与专家模仿对策略泛化能力与性能有何影响?
- RQ3一种动态平衡自我探索与专家数据采样的自适应经验回放机制,在多大程度上提升了学习稳定性与收敛性?
- RQ4在密集城市环岛场景中,所提方法在成功率、碰撞率与到达时间方面相较于SOTA强化学习与模仿学习基线方法表现如何?
- RQ5混合RL-IL方法是否能在安全性与效率方面超越纯规则驱动或端到端模仿学习方法?
主要发现
- 所提方法在测试中达到90%的成功率,显著优于所有基线方法,包括SAC(76%)与DQfD(80%)。
- 该方法碰撞率最低,仅为8%,远低于SAC的14%与DQfD的17%。
- 平均回合奖励为1205.3 ± 135.79,为所有方法中最高,表明累积性能更优。
- 平均回合时长为23.9 ± 6.5秒,为所有方法中最短,表明导航至目的地速度更快。
- 加入基于规则的安全控制器后,方法实现93%的成功率与5%的碰撞率,表明鲁棒性显著增强。
- 消融实验验证,专家模仿与自适应PER的结合显著加速收敛并提升最终性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。