[论文解读] A Versatile and Efficient Reinforcement Learning Framework for Autonomous Driving
本文提出了一种多功能且高效的强化学习框架,用于自动驾驶,通过将语义表征学习与端到端策略学习解耦,实现了卓越的仿真到真实环境的泛化能力。通过使用轻量级场景理解技术进行可行驶区域和车道线检测,再结合分布式异策略强化学习训练,该框架在单张GPU工作站上将训练时间缩短至13小时以内,并在夜间驾驶和复杂障碍物避让等多种场景下展现出稳健的现实世界性能。
Heated debates continue over the best autonomous driving framework. The classic modular pipeline is widely adopted in the industry owing to its great interpretability and stability, whereas the fully end-to-end paradigm has demonstrated considerable simplicity and learnability along with the rise of deep learning. As a way of marrying the advantages of both approaches, learning a semantically meaningful representation and then use in the downstream driving policy learning tasks provides a viable and attractive solution. However, several key challenges remain to be addressed, including identifying the most effective representation, alleviating the sim-to-real generalization issue as well as balancing model training cost. In this study, we propose a versatile and efficient reinforcement learning framework and build a fully functional autonomous vehicle for real-world validation. Our framework shows great generalizability to various complicated real-world scenarios and superior training efficiency against the competing baselines.
研究动机与目标
- 通过从原始摄像头输入中学习语义性、低维表征,解决端到端自动驾驶中的仿真到真实环境泛化差距问题。
- 通过混合方法克服模块化流水线(如误差累积、规则依赖过重)和端到端系统(如脆弱性、可解释性差)的局限性。
- 利用分布式、事件驱动的框架,提升深度强化学习在自动驾驶中的训练效率与可扩展性。
- 实现在物理自动驾驶车辆上对多样化且未见场景的框架真实世界部署与验证。
- 通过在语义表征上学习的鲁棒策略,实现在复杂环境(包括夜间驾驶和动态障碍物避让)下的高自主性与安全性。
提出的方法
- 使用轻量级场景理解模型,从原始摄像头图像中提取语义表征(可行驶区域与车道边界),构建标准化输入空间。
- 将表征学习与策略学习解耦,使下游强化学习策略可在紧凑且语义明确的特征上运行。
- 实施一种分布式、异策略强化学习框架,采用事件驱动的并行化机制,加速单个工作站上的训练过程。
- 采用灵活的调度机制,能随环境与智能体数量高效扩展,实现稳定的加速效果。
- 将学习到的强化学习策略与PID控制器集成,用于低层级控制执行,确保车辆动力学的稳定与安全。
- 所用感知模型的训练速度比CycleGAN快5倍,同时在速度与精度上均表现更优,显著降低计算成本。
实验结果
研究问题
- RQ1在策略学习之前先学习语义表征的解耦框架,是否能提升自动驾驶中的仿真到真实环境泛化能力?
- RQ2如何在单个工作站上高效扩展分布式异策略强化学习,以缩短训练时间而不损失性能?
- RQ3基于表征的强化学习框架在未见的真实世界场景(包括复杂道路拓扑与恶劣光照条件)下,其泛化能力达到何种程度?
- RQ4与强大的模仿学习与强化学习基线相比,该框架在真实世界自主性与安全性指标上的表现如何?
- RQ5轻量级、语义感知的感知模型是否能在效率与性能上均超越领域自适应技术(如CycleGAN)?
主要发现
- 该框架在配备2张RTX3090 GPU的单个工作站上,总训练时间缩短至12.6小时,相比非分布式基线(87.2小时)实现了85.6%的加速。
- 在障碍物避让任务中,框架取得98.3%的成功率,在直道车道保持任务中达到96.7%,显著优于模仿学习基线在自主性与安全性方面的表现。
- 在夜间条件下,基于强化学习的框架保持高性能(障碍物避让成功率92.5%),而模仿学习基线相比白天性能下降12.1%。
- 强化学习版本表现出更高的方向盘转角标准差,表明其采取更具攻击性的避障策略,而模仿学习版本则频繁与障碍物和路缘发生碰撞。
- 感知模型在仅用五分之一训练时间的情况下,性能超越CycleGAN,证明其在效率与有效性上的优越性。
- 在真实物理车辆上的部署验证了该框架在未见场景(包括强光照射、人行道、密集人群与车库)下的泛化能力,实现了稳定车道保持与动态障碍物避让。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。