[论文解读] Affordance-based Reinforcement Learning for Urban Driving
本文提出了一种基于可操作性的深度强化学习框架,利用航点和低维视觉可操作性来在城市环境中端到端训练驾驶策略。该方法从零开始使用近端策略优化(Proximal Policy Optimization)进行训练,代理模型学习到鲁棒且可泛化的行为,包括车道保持、交叉路口导航以及在交通灯前停车,其在CARLA的NoCrash基准测试中实现了最先进性能,成功率达到最高100%,在密集交通中几乎无违规行为。
Traditional autonomous vehicle pipelines that follow a modular approach have been very successful in the past both in academia and industry, which has led to autonomy deployed on road. Though this approach provides ease of interpretation, its generalizability to unseen environments is limited and hand-engineering of numerous parameters is required, especially in the prediction and planning systems. Recently, deep reinforcement learning has been shown to learn complex strategic games and perform challenging robotic tasks, which provides an appealing framework for learning to drive. In this work, we propose a deep reinforcement learning framework to learn optimal control policy using waypoints and low-dimensional visual representations, also known as affordances. We demonstrate that our agents when trained from scratch learn the tasks of lane-following, driving around inter-sections as well as stopping in front of other actors or traffic lights even in the dense traffic setting. We note that our method achieves comparable or better performance than the baseline methods on the original and NoCrash benchmarks on the CARLA simulator.
研究动机与目标
- 解决模块化方法和模仿学习在自动驾驶中的局限性,特别是对未见过环境的泛化能力差以及对专家示范的依赖。
- 克服在复杂城市驾驶场景中高维状态空间强化学习存在的样本效率低下和训练不稳定问题。
- 开发一种可扩展的端到端学习框架,无需人工设计组件即可泛化到新场景和罕见事件。
- 证明低维视觉可操作性与航点能够有效表征复杂的城市驾驶任务,同时实现稳定的策略学习。
- 在不依赖专家示范的情况下,仅使用环境中密集的奖励信号,实现与专家监督基线相当或更优的性能。
提出的方法
- 将驾驶任务建模为马尔可夫决策过程,使用航点和低维视觉可操作性(如到车道中心的距离、交通灯是否存在)作为状态表示。
- 采用无模型的在线策略强化学习算法——近端策略优化(Proximal Policy Optimization, PPO)——从原始观测端到端训练控制策略。
- 设计一个密集奖励函数,以鼓励安全、高效且合规的驾驶行为,包括导航成功、避免碰撞以及及时停车。
- 仅通过试错学习从零开始训练代理模型,避免使用任何专家示范或监督预训练。
- 探索三种状态表示变体:(A) 手工设计的可操作性与航点,(B) 通过卷积编码器学习的可操作性,(C) 用于消融实验的原始RGB图像。
- 在城镇(Town 01 和 Town 02)之间应用课程学习和领域随机化,以提升训练过程中的泛化能力和鲁棒性。
实验结果
研究问题
- RQ1仅使用低维可操作性与航点,深度强化学习代理是否能够学习到复杂的城市驾驶行为,如车道保持、交叉路口导航和交通灯合规?
- RQ2从零开始训练的强化学习代理在成功率和安全性方面,与专家监督或模仿学习基线相比表现如何?
- RQ3与从原始图像端到端学习表示相比,使用手工设计的可操作性是否能提升样本效率和策略鲁棒性?
- RQ4在无需微调的情况下,代理在未见过的环境(如Town 02)和罕见交通场景(如密集城市交通)中能泛化到何种程度?
- RQ5状态表示设计(手工设计 vs. 学习得到的可操作性)对策略性能和训练稳定性有何影响?
主要发现
- 所提方法在Empty交通条件下,于Town 01和Town 02上均实现了NoCrash基准测试的100%成功率,且无碰撞或超时事件。
- 在Regular交通条件下,代理在Town 02上实现了98.16%的成功率,显著优于CIL(22.00%)、CAL(27.67%)和CILRS(49.00%)等基线方法。
- 在Dense交通条件下,代理在Town 01上实现95.38%的成功率,在Town 02上实现91.20%的成功率,与基线相比碰撞率至少降低了一个数量级。
- 在Empty条件下,代理对其他车辆的碰撞率为0.00%,对行人的碰撞率也为0.00%,展现出极高的安全性和可靠性。
- 使用手工设计可操作性(A)的变体在性能和鲁棒性方面优于端到端学习可操作性的变体(B),后者需要更多样本且稳定性较低。
- 与先前的模仿学习和模块化基线相比,该方法在所有交通和城镇条件下均将超时和碰撞违规行为减少了至少一个数量级。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。