[论文解读] Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning
本文提出了一种用于自动驾驶车辆行为规划的分层强化学习(HRL)框架,通过模块化、基于注意力的架构,实现了对多个子目标(如跟随前车或在停车标志前停止)的高效学习。该方法采用混合奖励机制和分层优先经验回放,相较于传统强化学习,实现了更快的收敛速度和更高的样本效率,并支持子策略模块在不同任务间的迁移使用。
In this work, we propose a hierarchical reinforcement learning (HRL) structure which is capable of performing autonomous vehicle planning tasks in simulated environments with multiple sub-goals. In this hierarchical structure, the network is capable of 1) learning one task with multiple sub-goals simultaneously; 2) extracting attentions of states according to changing sub-goals during the learning process; 3) reusing the well-trained network of sub-goals for other similar tasks with the same sub-goals. The states are defined as processed observations which are transmitted from the perception system of the autonomous vehicle. A hybrid reward mechanism is designed for different hierarchical layers in the proposed HRL structure. Compared to traditional RL methods, our algorithm is more sample-efficient since its modular design allows reusing the policies of sub-goals across similar tasks. The results show that the proposed method converges to an optimal policy faster than traditional RL methods.
研究动机与目标
- 为解决传统强化学习在自动驾驶车辆行为规划中面临的问题,特别是处理多个子目标时收敛速度慢、样本效率差的局限性。
- 开发一种分层深度强化学习结构,以实现对不同驾驶行为(如跟随前车或在停车标志前停止)的模块化学习。
- 通过在共享的分层框架内解耦子目标策略,提升训练策略在相似任务间的可重用性。
- 设计一种混合奖励机制,以有效评估不同层次决策过程中的性能表现。
- 通过专为HRL设计的分层优先经验回放机制,提升训练的稳定性和效率。
提出的方法
- 该框架采用两级HRL结构:高层选项网络选择子目标(例如,停车标志前停止、跟随前车),而低层策略则根据所选选项执行动作。
- 一种状态注意力机制可根据当前子目标,动态地在相关状态特征(如与前车的距离、与停车标志的距离)之间转移关注焦点。
- 混合奖励函数在低层结合密集的奖励塑造,在高层采用稀疏且任务特定的奖励,以指导分层决策过程中的学习。
- 分层优先经验回放(H-PER)机制通过优先选择对高层和低层策略更新最具信息量的转移样本,提升了样本效率。
- 模型使用深度Q网络(DQN和DDQN)进行策略学习,分别对动作级策略(如跟随前车)和选项级策略(如在停止与跟随之间选择)进行独立训练。
- 该架构支持模块化部署:训练好的子策略(如跟随前车)可在新任务中独立复用,而无需重新训练整个系统。
实验结果
研究问题
- RQ1分层强化学习框架是否能在一个统一的训练过程中,有效学习多个自动驾驶车辆行为子目标(如在停车标志前停止和跟随前车)?
- RQ2状态注意力机制的引入在动态驾驶场景中如何提升策略的泛化能力和适应性?
- RQ3与标准的密集奖励或稀疏奖励函数相比,混合奖励机制在多大程度上提升了学习效率和收敛速度?
- RQ4在复杂驾驶环境中,所提出的HRL框架是否相比传统深度强化学习实现了更高的样本效率和更快的收敛速度?
- RQ5训练好的子策略在多大程度上可跨不同任务复用,从而实现自动驾驶车辆中模块化且可扩展的行为规划?
主要发现
- 所提出的混合HRL方法在训练曲线中表现出更快的性能提升,相较于传统强化学习方法,实现了更快的收敛至最优策略。
- 分层优先经验回放(H-PER)机制显著提升了样本效率,减少了达到高性能所需的训练步数。
- 注意力机制成功根据当前子目标,动态地在状态特征(如与前车的距离、与停车标志的距离)之间调整关注焦点,提升了策略的鲁棒性。
- 针对跟随前车(FFV)的训练策略在测试中取得了98%的成功率,而停车线策略(SSL)达到了95%的成功率,表明其在孤立任务中具有高度可靠性。
- 选项级策略(基于环境条件在FFV与SSL之间选择)在复杂交叉路口场景中实现了92%的成功率,优于人工设计的规则系统。
- 模块化设计使得FFV策略可在新任务中无需重新训练即可复用,证实了该框架在相似驾驶行为间的可扩展性和可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。