[论文解读] Multi-Vehicle Mixed-Reality Reinforcement Learning for Autonomous Multi-Lane Driving
本文提出了一种混合现实强化学习框架,通过结合真实世界策略适应与虚拟车辆交互,在多车、多车道环境中实现了安全、高效的自动驾驶策略训练。通过在虚拟领域模拟碰撞,同时在真实车辆上部署智能体,该方法仅经过几次混合现实训练后,碰撞次数减少了80%以上,展示了多智能体自动驾驶中有效的模拟到现实的迁移能力。
Autonomous driving promises to transform road transport. Multi-vehicle and multi-lane scenarios, however, present unique challenges due to constrained navigation and unpredictable vehicle interactions. Learning-based methods---such as deep reinforcement learning---are emerging as a promising approach to automatically design intelligent driving policies that can cope with these challenges. Yet, the process of safely learning multi-vehicle driving behaviours is hard: while collisions---and their near-avoidance---are essential to the learning process, directly executing immature policies on autonomous vehicles raises considerable safety concerns. In this article, we present a safe and efficient framework that enables the learning of driving policies for autonomous vehicles operating in a shared workspace, where the absence of collisions cannot be guaranteed. Key to our learning procedure is a sim2real approach that uses real-world online policy adaptation in a mixed-reality setup, where other vehicles and static obstacles exist in the virtual domain. This allows us to perform safe learning by simulating (and learning from) collisions between the learning agent(s) and other objects in virtual reality. Our results demonstrate that, after only a few runs in mixed-reality, collisions are significantly reduced.
研究动机与目标
- 解决在多车、多车道环境中训练自动驾驶策略时,学习过程中频繁发生碰撞的安全挑战。
- 通过混合现实设置将真实世界部署与易发生碰撞的训练过程解耦,实现安全的策略学习。
- 通过在真实硬件上进行在线策略适应,同时在虚拟环境中模拟与其他车辆和障碍物的交互,弥合自动驾驶强化学习中的现实差距。
- 证明端到端驾驶策略可通过在混合现实环境中进行最少的真实世界交互,有效学习并持续改进。
- 为在共享交通空间中训练多个自动驾驶智能体提供可扩展、安全的框架,避免物理损坏风险。
提出的方法
- 该框架采用专为混合现实设计的分布式强化学习设置,其中一个真实的DeepRacer智能体在物理赛道上学习,同时在仿真中模拟16个虚拟车辆和静态障碍物。
- 虚拟车辆采用标准交通模型(IDM和MOBIL)进行建模,以生成逼真、动态的交互行为。
- 实时收集智能体与虚拟智能体及障碍物交互的经验,并在线更新真实车辆的策略。
- 碰撞在虚拟领域中被模拟,使智能体能够在无物理风险的情况下从近似碰撞和失败中学习。
- 系统采用模拟到现实的方法,利用真实车辆的动力学特性与传感器反馈来适应策略,从而最小化现实差距。
- 该方法采用无模型深度强化学习,具有连续动作空间,使用离策略算法进行训练,以提高样本效率。
实验结果
研究问题
- RQ1能否为多车自动驾驶开发一种安全且高效的强化学习框架,使策略训练过程中避免物理损坏?
- RQ2与仅使用仿真或仅使用真实世界训练相比,混合现实强化学习在减少碰撞和提升策略性能方面有多高效?
- RQ3在混合现实设置中,真实世界在线策略适应在多大程度上能够减少自动驾驶策略学习中的现实差距?
- RQ4当与更快、更灵敏的虚拟智能体交互时,真实硬件(如DeepRacer)的动力学特性如何影响策略学习?
- RQ5单个真实车辆能否通过与共享多车道环境中的虚拟交通交互,学习到稳健的避碰行为?
主要发现
- 仅在混合现实环境中进行几次训练后,碰撞次数显著减少,碰撞密度分布明显向左移动。
- 训练后碰撞分布不仅均值更低,且分布更窄,表明方差减小,策略一致性提升。
- 在测试中,所学策略获得了更高的累积奖励,证实强化学习过程成功提升了性能。
- 定性结果显示,真实车辆在混合现实训练后,从频繁碰撞转变为近乎碰撞规避,表明行为适应有效。
- 真实车辆响应速度较慢导致行为更加谨慎,降低了碰撞风险,但也引发了交通拥堵,表明安全与通行效率之间存在权衡。
- 在仿真中使用高熵策略有助于智能体更好地泛化到真实世界的混合现实设置,实现在不发生过拟合的前提下快速适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。