[论文解读] Driving in Real Life with Inverse Reinforcement Learning
本论文提出DriveIRL,这是首个基于逆强化学习(IRL)的自动驾驶端到端运动规划方法,适用于密集城市交通场景。该方法生成多样化、安全的轨迹,应用轻量级安全过滤器,并利用在拉斯维加斯采集的500多小时真实专家驾驶数据上训练的端到端评分模型,实现了出色的现实世界表现,包括在复杂交通场景中实现完全自动驾驶,应对切入车辆和复杂操作。
In this paper, we introduce the first learning-based planner to drive a car in dense, urban traffic using Inverse Reinforcement Learning (IRL). Our planner, DriveIRL, generates a diverse set of trajectory proposals, filters these trajectories with a lightweight and interpretable safety filter, and then uses a learned model to score each remaining trajectory. The best trajectory is then tracked by the low-level controller of our self-driving vehicle. We train our trajectory scoring model on a 500+ hour real-world dataset of expert driving demonstrations in Las Vegas within the maximum entropy IRL framework. DriveIRL's benefits include: a simple design due to only learning the trajectory scoring function, relatively interpretable features, and strong real-world performance. We validated DriveIRL on the Las Vegas Strip and demonstrated fully autonomous driving in heavy traffic, including scenarios involving cut-ins, abrupt braking by the lead vehicle, and hotel pickup/dropoff zones. Our dataset will be made public to help further research in this area.
研究动机与目标
- 开发一种基于学习的运动规划器,能够在不依赖手工调校代价函数的情况下处理复杂、密集的城市驾驶场景。
- 解决传统规划方法依赖大量人工调校启发式代价函数进行行为选择的局限性。
- 通过从专家示范中学习细微的驾驶行为,提升自动驾驶的泛化能力和安全性。
- 在高密度交通和不可预测的人类驾驶员环境下,通过真实世界城市环境验证该方法的性能。
- 发布大规模真实世界驾驶数据集,以支持未来基于IRL的运动规划研究。
提出的方法
- 使用简单且可解释的轨迹生成模块,生成多样化、动力学可行、符合路线要求且与控制器兼容的自车轨迹。
- 应用轻量级、递归式安全过滤器,确保每条轨迹都具备安全延续性,提供形式化安全保证。
- 基于拉斯维加斯采集的500多小时真实世界专家驾驶数据,使用最大熵逆强化学习(MaxEnt IRL)训练轨迹评分模型。
- 将学习能力完全集中于轨迹评分任务,实现轨迹生成与安全执行任务的解耦。
- 将评分最高的轨迹作为输入,交由底层车辆控制器执行。
- 通过闭环仿真和在拉斯维加斯大道上的真实世界测试,验证系统的鲁棒性与安全性。
实验结果
研究问题
- RQ1通过逆强化学习训练的基于学习的规划器,是否能在密集城市交通中实现稳健、安全且类人驾驶的表现?
- RQ2将轨迹生成、安全检查与评分任务分离,如何提升规划系统的可学习性与可解释性?
- RQ3所学习的评分模型在多大程度上能泛化至复杂真实场景,如激进切入和乘客上下车区域?
- RQ4与纯端到端学习方法相比,集成轻量级安全过滤器如何提升真实世界部署的可靠性?
- RQ5在真实世界专家示范数据上训练的模型,是否能在安全性与舒适性指标上超越经典规则驱动规划器(如智能驾驶员模型)?
主要发现
- DriveIRL在拉斯维加斯大道上实现了完全自动驾驶,成功应对密集交通、激进切入、急刹车以及酒店接送区域等复杂场景。
- 在安全过滤器的保障下,车辆在大道上8.5英里中保持自动驾驶6.9英里,仅在强制接管区域发生人工接管。
- 若无安全过滤器,车辆在11英里中自动驾驶8.8英里,表明其基线性能已非常出色。
- 搭载安全过滤器的基线模型在所有安全指标上均优于IDM基线和恒速基线,包括碰撞率(0.001 vs. 0.005)和尾随率(0.006 vs. 0.019)。
- 所学习模型的舒适度得分为0.815,安全性得分为0.930,显著优于IDM基线(安全性0.891,舒适度0.898)。
- 该模型的ℓ₂误差(2.204)低于IDM基线(4.478),表明其轨迹跟踪更精准,运动轨迹更接近人类驾驶特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。