[论文解读] Learning hierarchical behavior and motion planning for autonomous driving
该论文提出了一种用于自动驾驶的分层行为与运动规划(HBMP)框架,通过将基于采样的运动规划器的最优成本作为密集奖励,集成到高层行为强化学习(RL)中,从而提升战术决策能力。通过解耦行为与运动规划,并利用快速仿真器(SUMO)中的模仿学习进行策略初始化,该方法实现了高效的训练和强大的泛化能力,成功将策略直接部署到真实世界驾驶中而无需微调。
Learning-based driving solution, a new branch for autonomous driving, is expected to simplify the modeling of driving by learning the underlying mechanisms from data. To improve the tactical decision-making for learning-based driving solution, we introduce hierarchical behavior and motion planning (HBMP) to explicitly model the behavior in learning-based solution. Due to the coupled action space of behavior and motion, it is challenging to solve HBMP problem using reinforcement learning (RL) for long-horizon driving tasks. We transform HBMP problem by integrating a classical sampling-based motion planner, of which the optimal cost is regarded as the rewards for high-level behavior learning. As a result, this formulation reduces action space and diversifies the rewards without losing the optimality of HBMP. In addition, we propose a sharable representation for input sensory data across simulation platforms and real-world environment, so that models trained in a fast event-based simulator, SUMO, can be used to initialize and accelerate the RL training in a dynamics based simulator, CARLA. Experimental results demonstrate the effectiveness of the method. Besides, the model is successfully transferred to the real-world, validating the generalization capability.
研究动机与目标
- 通过显式建模行为规划为分层组件,提升基于学习的自动驾驶中的战术决策能力。
- 通过将HBMP重新表述为高层行为学习问题,解决长时程驾驶任务中耦合动作空间的挑战。
- 通过使用最优运动规划器成本作为密集且信息丰富的奖励,实现高效且稳定的强化学习训练。
- 通过使用快速事件驱动仿真器(SUMO)中预训练的模仿学习策略进行初始化,加速强化学习策略训练。
- 通过设计仿真与真实世界平台间可共享的感官表征,确保策略在真实世界环境中的泛化能力。
提出的方法
- 将HBMP问题重新表述为等效的高层行为学习问题,其中奖励来源于经典基于采样运动规划器的最优成本。
- 使用基于采样的运动规划器(如RRT*)计算每个行为决策的最优轨迹成本,该成本随后作为高层行为策略的奖励信号。
- 引入一种变形占据栅格表征$M_t$,其在仿真平台(SUMO与CARLA)及真实世界环境中保持一致,从而支持跨平台策略迁移。
- 在CARLA上通过深度强化学习(PPO)训练行为策略,初始策略来自在SUMO上使用共享$M_t$表征预训练的模仿学习策略。
- 解耦行为与运动规划:高层策略选择行为(如变道、加速),低层运动规划器生成执行该行为的轨迹。
- 应用领域随机化与传感器噪声增强,以提升真实世界部署中的鲁棒性。
实验结果
研究问题
- RQ1将最优运动规划器成本作为密集奖励,是否能提升长时程自动驾驶任务中高层行为策略学习的样本效率与收敛性?
- RQ2所提出的可共享感官表征($M_t$)在实现从快速事件驱动仿真器(SUMO)到高保真动力学仿真器(CARLA)乃至真实世界部署的策略迁移方面,效果如何?
- RQ3与缺乏显式行为建模的端到端学习方法相比,HBMP框架在战术决策能力方面提升了多少?
- RQ4该策略在无需重新训练的情况下,能否在多样化城市环境(如Town1至Town5)中泛化,并有效应对动态交通参与者?
- RQ5该方法是否能够在仅依赖共享感官表征进行领域自适应的前提下,实现无需微调的真实世界策略部署?
主要发现
- HBMP策略在CARLA基准测试中,Town1的成功率达到95%,Town2达到88%,显著优于基线方法。
- 在Town1至Town5的跨环境测试中,模型在所有地图上的成功率均超过85%,展现出强大的泛化能力。
- 真实世界车辆测试表明,该策略成功导航了700米的校园路线,包含双车道与弯曲车道,保持车道保持并执行了安全的超车操作,全程无需人工干预。
- 在包含骑行者的动态场景中,车辆正确执行了减速与加速操作,并完成了多次自主变道,未出现急刹车。
- 策略从仿真直接迁移至真实世界,未进行任何微调,验证了共享感官表征$M_t$的有效性。
- 该方法在CARLA的训练与测试场景中均表现出优越性能,运动规划器提供的密集奖励显著加快了强化学习的收敛速度并提升了训练稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。