Skip to main content
QUICK REVIEW

[论文解读] Imitating Driver Behavior with Generative Adversarial Networks

Alex Kuefler, Jeremy Morton|arXiv (Cornell University)|Jan 24, 2017
Autonomous Vehicle Technology and Safety参考文献 29被引用 5
一句话总结

本文提出一种基于循环神经网络(GRUs)的生成对抗模仿学习(GAIL)框架,用于建模人类高速公路驾驶行为,实现鲁棒的长时程仿真,性能优于行为克隆(BC)和基于规则的模型。通过使用来自NGSIM数据集的专家轨迹,利用对抗性奖励信号训练策略,该方法减少了级联误差,实现了真实的变道行为、控制稳定性以及较低的偏离道路/碰撞率。

ABSTRACT

The ability to accurately predict and simulate human driving behavior is critical for the development of intelligent transportation systems. Traditional modeling methods have employed simple parametric models and behavioral cloning. This paper adopts a method for overcoming the problem of cascading errors inherent in prior approaches, resulting in realistic behavior that is robust to trajectory perturbations. We extend Generative Adversarial Imitation Learning to the training of recurrent policies, and we demonstrate that our model outperforms rule-based controllers and maximum likelihood models in realistic highway simulations. Our model both reproduces emergent behavior of human drivers, such as lane change rate, while maintaining realistic control over long time horizons.

研究动机与目标

  • 解决行为克隆在长时程驾驶中因级联误差导致的性能下降问题。
  • 通过从专家轨迹中学习,而无需依赖手工设计的奖励函数,提升长期驾驶仿真的保真度。
  • 将GAIL扩展至循环策略,以更好地建模驾驶员行为的时间动态特性。
  • 在真实的高速公路仿真中,评估模型相对于基于规则的控制器和最大似然模型的性能。
  • 证明结合循环网络的GAIL能够捕捉如变道频率等涌现行为,同时保持稳定性。

提出的方法

  • 该方法使用生成对抗模仿学习(GAIL)训练策略网络,使其输出的动作与专家示范难以区分,利用判别器网络实现。
  • 采用循环策略网络(GRU)建模驾驶序列中的时间依赖性,相比前馈网络,可更好地模拟长时程行为。
  • 策略通过端到端方式训练,输入为原始LIDAR数据和人工挑选的道路特征,输出为连续的转向速率和加速度动作。
  • 判别器被训练以区分专家动作与策略生成的动作,而策略则通过欺骗判别器进行更新,形成极小化极大博弈。
  • 训练过程使用来自NGSIM数据集的专家轨迹,状态表示包括LIDAR距离和距离变化率。
  • 该框架通过使用来自判别器的替代奖励,避免了显式的奖励塑形,从而在无需预先建模奖励函数的情况下实现鲁棒模仿。

实验结果

研究问题

  • RQ1与行为克隆相比,结合循环策略的GAIL是否能减少长时程驾驶仿真中的级联误差?
  • RQ2在GAIL中使用循环网络是否能改善对人类驾驶行为时间动态的建模?
  • RQ3与基于规则的控制器(如IDM + MOBIL)相比,GAIL策略在碰撞率和偏离道路率方面表现如何?
  • RQ4GAIL策略在多大程度上复现了如变道频率和平稳制动等人类驾驶的涌现行为?
  • RQ5该模型是否能在未见过的状态和扰动下保持稳定,而不会发散,与行为克隆形成对比?

主要发现

  • GAIL GRU策略在所有模型中实现了最低的偏离道路时长和碰撞率,优于行为克隆和基于规则的控制器。
  • 在变道频率方面,GAIL GRU策略最接近真实人类驾驶行为,优于所有其他模型,包括IDM + MOBIL。
  • GAIL GRU策略在转向速率和加速度变化率(jerk)上的KL散度最低,尽管在直道上表现出轻微的转向速率振荡。
  • 行为克隆模型因级联误差而出现严重性能下降,尽管其短时程表现良好,但导致了较高的偏离道路和碰撞率。
  • 与非循环GAIL相比,基于GRU的GAIL模型减少了加速度振荡,但仍比人类驾驶员产生更多振荡。
  • GAIL策略的变道频率与专家数据相差仅1.5%,而BC和SG模型则显著表现不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。