[论文解读] Decision Making for Autonomous Driving via Augmented Adversarial Inverse Reinforcement Learning
本文提出增强对抗逆强化学习(AugAIRL),通过在判别器中集成可训练的语义奖励项来提升AIRL的性能,从而在复杂、交互式的自动驾驶场景中实现更稳定的学习与更优的表现。在变道任务上的评估显示,AugAIRL在四项指标上均达到与专家演示相当的性能,优于GAIL、AIRL、TRPO及BC+TRPO基线方法,在训练和测试阶段均表现更优。
Making decisions in complex driving environments is a challenging task for autonomous agents. Imitation learning methods have great potentials for achieving such a goal. Adversarial Inverse Reinforcement Learning (AIRL) is one of the state-of-art imitation learning methods that can learn both a behavioral policy and a reward function simultaneously, yet it is only demonstrated in simple and static environments where no interactions are introduced. In this paper, we improve and stabilize AIRL's performance by augmenting it with semantic rewards in the learning framework. Additionally, we adapt the augmented AIRL to a more practical and challenging decision-making task in a highly interactive environment in autonomous driving. The proposed method is compared with four baselines and evaluated by four performance metrics. Simulation results show that the augmented AIRL outperforms all the baseline methods, and its performance is comparable with that of the experts on all of the four metrics.
研究动机与目标
- 解决在无需手动设计奖励函数的前提下,学习类人交互式决策的挑战。
- 提升并稳定对抗逆强化学习(AIRL)在动态、交互式环境中的性能。
- 开发一种轻量化、可泛化的语义奖励集成方法,用于模仿学习框架。
- 在高密度交通、交互性强的真实变道决策任务中评估该方法。
- 构建具备语义意义动作的系统,并采用四项综合评估指标。
提出的方法
- 通过将与状态相关的语义奖励项拼接至判别器网络中,对AIRL框架进行增强,以指导策略与奖励学习。
- 将奖励权重作为对抗训练过程的一部分进行端到端训练,使模型能够学习语义奖励的最优幅度。
- 采用生成对抗框架,其中判别器区分专家演示与专家生成的轨迹,同时联合学习奖励函数与策略。
- 将增强后的框架适配至包含多个交互智能体与复杂变道场景的模拟自动驾驶环境。
- 采用具有循环结构的策略网络以建模序列决策过程,并设计同时具备专家与智能体轨迹判别能力及语义奖励监督功能的判别器。
- 整合四项评估指标——总奖励、成功率、决策步数与变道步数,以全面评估性能。
实验结果
研究问题
- RQ1在交互式自动驾驶任务中,将语义奖励集成至AIRL框架是否能提升学习稳定性和性能?
- RQ2在各项评估指标下,AugAIRL与基线模仿学习及强化学习方法相比,在模仿保真度与鲁棒性方面表现如何?
- RQ3在无显式奖励塑造的情况下,AugAIRL在复杂动态变道场景中能在多大程度上恢复专家级行为?
- RQ4与标准AIRL和GAIL相比,语义奖励的引入是否带来更快的收敛速度与更低的策略性能方差?
- RQ5所学习的奖励函数是否能在不同驾驶场景中泛化,并对新环境的适应具有实际应用价值?
主要发现
- AugAIRL在所有方法中获得最高总奖励,在所有训练与测试阶段均持续接近专家水平表现。
- 在测试阶段,AugAIRL的成功率达到1.0,表明变道完成度近乎完美,且收敛速度优于其他方法。
- AugAIRL所需决策步数与变道步数最少,表明其动作高效且时机恰当,与专家行为高度一致。
- 在所有指标中,该方法表现出最低的性能方差,相较于GAIL、AIRL、TRPO及BC+TRPO,稳定性更优。
- 在训练与测试阶段,AugAIRL全面优于所有基线方法,且在测试阶段性能差距进一步扩大,表明其具备更强的泛化能力与鲁棒性。
- 学习曲线的形态显示,智能体初期行为较为保守,但逐步学会果断执行变道,模仿了专家的犹豫与时机把握。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。