[论文解读] Driver Dojo: A Benchmark for Generalizable Reinforcement Learning for Autonomous Driving
Driver Dojo 是一个基于 SUMO 构建的灵活可配置基准环境,用于评估自动驾驶中可泛化的强化学习。它支持随机道路布局、多样的交通场景、多种观测与动作空间,以及车辆动力学模型,能够在各种驾驶条件下对强化学习策略进行严格测试,具备完全可复现性与模块化设计。
Reinforcement learning (RL) has shown to reach super human-level performance across a wide range of tasks. However, unlike supervised machine learning, learning strategies that generalize well to a wide range of situations remains one of the most challenging problems for real-world RL. Autonomous driving (AD) provides a multi-faceted experimental field, as it is necessary to learn the correct behavior over many variations of road layouts and large distributions of possible traffic situations, including individual driver personalities and hard-to-predict traffic events. In this paper we propose a challenging benchmark for generalizable RL for AD based on a configurable, flexible, and performant code base. Our benchmark uses a catalog of randomized scenario generators, including multiple mechanisms for road layout and traffic variations, different numerical and visual observation types, distinct action spaces, diverse vehicle models, and allows for use under static scenario definitions. In addition to purely algorithmic insights, our application-oriented benchmark also enables a better understanding of the impact of design decisions such as action and observation space on the generalizability of policies. Our benchmark aims to encourage researchers to propose solutions that are able to successfully generalize across scenarios, a task in which current RL methods fail. The code for the benchmark is available at https://github.com/seawee1/driver-dojo.
研究动机与目标
- 为解决自动驾驶中强化学习缺乏标准化、可泛化的基准问题,以支持在多样化交通与道路配置下的鲁棒性与可迁移性。
- 实现对强化学习算法在动态、随机化驾驶场景中的系统性评估,以模拟真实世界中交通行为与基础设施的多样性。
- 探究设计选择(如动作与观测空间、车辆动力学、场景随机化)如何影响自动驾驶中策略的泛化性能。
- 提供一个模块化、高性能且可复现的代码库,支持强化学习在自动驾驶中算法研究与面向应用的泛化分析。
- 推动开发能够超越特定训练场景泛化的强化学习智能体,解决当前方法在实际部署中面临的关键局限。
提出的方法
- 以交通与道路网络生成的仿真核心引擎——仿真城市交通(SUMO)框架为基础。
- 采用一系列可配置参数的随机场景生成器,涵盖交叉路口、环岛与高速公路任务,支持道路布局、交通密度与车辆行为的自定义。
- 支持多种观测模态(如数值型、视觉型)与动作空间(直接控制与语义控制),并提供五种不同的车辆动力学模型。
- 引入基于车辆的采样机制,用于物理与行为属性(如速度、激进程度)的建模,以实现异构交通行为的模拟。
- 支持通过确定性种子实现静态场景部署以保证可复现性,同时支持动态随机化以测试泛化能力。
- 基于 Tianshou 与 Hydra 构建模块化、高性能的代码库,支持灵活的环境组合与实验配置。
实验结果
研究问题
- RQ1不同的观测与动作空间设计在多样化自动驾驶场景中对强化学习智能体泛化性能有何影响?
- RQ2标准强化学习算法(如 DQN、PPO、FQF)在自动驾驶中对随机道路布局与交通条件的泛化能力达到何种程度?
- RQ3引入异构车辆行为与动态交通初始化对策略鲁棒性与泛化性能有何影响?
- RQ4是否可通过支持可配置场景生成的统一基准环境,提升自动驾驶领域强化学习研究中的可复现性与可比性?
- RQ5当在标准训练分布之外的未见随机驾驶场景中测试时,当前强化学习方法的失败模式是什么?
主要发现
- 在交叉路口场景中,使用 TPS 动作空间训练的策略,FQF-100 的碰撞率为 16.25%,完成率为 55.91%,表明其泛化性能中等。
- 在高速公路出口场景中,FQF-100 智能体的碰撞率为 10.49%,完成率为 29.92%,凸显了在复杂高速公路操作中泛化面临的显著挑战。
- 训练 10,000 个回合后,完成率出现显著下降(例如,DQN 在交叉路口场景中从 59.06% 降至 34.87%),表明其对特定训练条件存在过拟合现象。
- 在交叉路口场景中,PPO 智能体在 100 个回合训练下,完成率为 56.06%,碰撞率为 23.87%,表明其在相同条件下比 DQN 具有更好的样本效率。
- 基于视觉的模型需要更多计算资源,且性能波动较大,训练使用配备四块 Tesla V100 显卡与 187GB 内存的 GPU 节点,表明其计算资源消耗较大。
- 该基准通过确定性种子与模块化配置实现了完全可复现性,所有实验均在 GitHub 仓库的 README.md 中有完整记录。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。