Skip to main content
QUICK REVIEW

[论文解读] Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients

Oliver Scheel, Luca Bergamini|arXiv (Cornell University)|Sep 27, 2021
Autonomous Vehicle Technology and Safety被引用 14
一句话总结

本文提出 Urban Driver,这是首个从100小时真实世界示范数据中学习复杂城市驾驶策略的离线策略梯度方法。通过利用基于中层表征和高清地图构建的可微、数据驱动的仿真器,该方法实现了无需在线策略数据收集的闭环策略训练,在仿真和真实自动驾驶车辆部署中均达到最先进性能。

ABSTRACT

In this work we are the first to present an offline policy gradient method for learning imitative policies for complex urban driving from a large corpus of real-world demonstrations. This is achieved by building a differentiable data-driven simulator on top of perception outputs and high-fidelity HD maps of the area. It allows us to synthesize new driving experiences from existing demonstrations using mid-level representations. Using this simulator we then train a policy network in closed-loop employing policy gradients. We train our proposed method on 100 hours of expert demonstrations on urban roads and show that it learns complex driving policies that generalize well and can perform a variety of driving maneuvers. We demonstrate this in simulation as well as deploy our model to self-driving vehicles in the real-world. Our method outperforms previously demonstrated state-of-the-art for urban driving scenarios -- all this without the need for complex state perturbations or collecting additional on-policy data during training. We make code and data publicly available.

研究动机与目标

  • 开发一种可扩展、数据驱动的方法,直接从大规模真实世界示范数据中学习城市驾驶策略。
  • 解决模仿学习在城市环境中的局限性,特别是由于分布偏移导致的协变量偏移和泛化能力差的问题。
  • 在闭环设置中使用策略梯度实现端到端策略训练,避免依赖启发式扰动或人工设计的成本函数。
  • 在真实物理自动驾驶车辆上展示所学策略的泛化能力和实际部署能力。
  • 提供一种可扩展、高效的训练流程,通过时间反向传播在向量化表征上实现快速策略梯度计算。

提出的方法

  • 利用真实世界示范日志和高保真高清地图构建可微、数据驱动的仿真器,以合成新的、逼真的驾驶场景。
  • 采用中层向量化表征(如车道结构、交通灯、智能体轨迹)作为仿真器的输入,实现高效且可微的仿真。
  • 在闭环设置中使用策略梯度训练策略网络,使模型能够优化长时序驾驶行为和辅助目标。
  • 通过向量化表征和时间反向传播高效计算策略梯度,降低在大规模数据集上的训练复杂度。
  • 采用闭环展开机制在可微仿真器内模拟策略滚动,实现具有时间一致性的端到端训练。
  • 通过依赖仿真器从现有示范中生成多样化、逼真的场景,避免了在线策略数据收集和复杂状态扰动。

实验结果

研究问题

  • RQ1是否可以将策略梯度方法有效应用于复杂城市驾驶的离线模仿学习,而无需在线策略数据收集?
  • RQ2基于真实世界日志和高清地图构建的可微、数据驱动仿真器,能否有效支持城市驾驶的闭环策略训练?
  • RQ3与现有的行为克隆和扰动基方法相比,所提方法在泛化能力和鲁棒性方面表现如何?
  • RQ4在纯仿真中训练的策略在未见城市场景中,能否成功控制真实世界自动驾驶车辆?
  • RQ5该方法是否能在无需显式奖励塑造的情况下,同时优化模仿目标和辅助目标(如舒适性、安全性)?

主要发现

  • 所提方法在仿真中优于所有基线模型,I1K(15 ± 7)和L2(0.42 ± 0.00)指标最低,表明轨迹精度更高且碰撞更少。
  • 该方法实现15 ± 7次偏离道路碰撞和46 ± 5次追尾碰撞,显著低于行为克隆(79 ± 23 和 395 ± 170)以及BC-perturb(14 ± 4 和 73 ± 7)。
  • 该模型在之前未见过的私有测试赛道上表现出良好泛化能力,成功在信号灯控制的路口停车等待红灯,并在绿灯时继续行驶,真实部署中已得到验证。
  • 该方法实现637K ± 41K次舒适性失败,低于BC-perturb(636K ± 22K)和MS Prediction(595K ± 49K),表明对动态交互的处理能力更优。
  • 在仿真中训练的策略成功控制了配备7个摄像头、3个LiDAR和11个雷达的真实世界福特金牛座车辆,证实了其在真实场景中的可行性。
  • 该方法消除了对复杂状态扰动和在线策略数据收集的依赖,同时仍达到最先进性能,证明了对分布偏移的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。