[论文解读] Vision-Based Autonomous Car Racing Using Deep Imitative Reinforcement Learning
本文提出深度模仿强化学习(DIRL),一种统一框架,结合模仿学习(IL)与基于模型的强化学习(RL),用于训练端到端的视觉控制策略,实现自动驾驶卡丁车竞速。通过利用具备不确定性感知的世界模型(Reveries-net)模拟想象中的交互,DIRL在样本效率和性能方面均优于纯IL或RL基线方法,在仿真环境和真实世界1/20比例遥控卡丁车竞速中表现更优,且显著减少了对专家干预的需求。
Autonomous car racing is a challenging task in the robotic control area. Traditional modular methods require accurate mapping, localization and planning, which makes them computationally inefficient and sensitive to environmental changes. Recently, deep-learning-based end-to-end systems have shown promising results for autonomous driving/racing. However, they are commonly implemented by supervised imitation learning (IL), which suffers from the distribution mismatch problem, or by reinforcement learning (RL), which requires a huge amount of risky interaction data. In this work, we present a general deep imitative reinforcement learning approach (DIRL), which successfully achieves agile autonomous racing using visual inputs. The driving knowledge is acquired from both IL and model-based RL, where the agent can learn from human teachers as well as perform self-improvement by safely interacting with an offline world model. We validate our algorithm both in a high-fidelity driving simulation and on a real-world 1/20-scale RC-car with limited onboard computation. The evaluation results demonstrate that our method outperforms previous IL and RL methods in terms of sample efficiency and task performance. Demonstration videos are available at https://caipeide.github.io/autorace-dirl/
研究动机与目标
- 为解决传统模块化与端到端深度学习方法在自动驾驶卡丁车竞速中的局限性,特别是模仿学习中的分布偏移问题以及强化学习的样本效率低下问题。
- 开发一种统一的学习框架,结合模仿学习的数据效率与基于模型的强化学习的自我改进能力。
- 通过离线世界模型实现安全且高效的策略训练,最大限度减少真实世界交互与专家干预。
- 在高保真仿真环境与真实世界1/20比例遥控卡丁车竞速中验证该方法,且在计算资源受限的车载系统上实现。
提出的方法
- 提出Reveries-net,一种带有证据不确定性估计的循环神经网络,用于从视觉输入中学习动作条件化的概率世界模型。
- 使用模仿学习初始化视觉控制策略,利用专家示范数据提供一个强初始策略。
- 应用基于模型的强化学习,通过在学习到的世界模型中模拟未来轨迹来优化策略,实现在无需真实世界交互情况下的安全自我改进。
- 在策略训练过程中将不确定性估计作为正则化信号,提升策略的鲁棒性与安全性。
- 采用闭环重规划策略,使策略在每个时间步均基于实时观测与预测结果重新评估动作。
- 仅在离线世界模型中训练策略,降低对真实世界轨迹采样的依赖,实现高效数据学习。
实验结果
研究问题
- RQ1结合IL与基于模型的RL的统一框架,是否能在自动驾驶竞速任务中实现比独立使用IL或RL更高的样本效率与任务性能?
- RQ2不确定性感知的世界建模在离线训练过程中如何提升策略的安全性与鲁棒性?
- RQ3在仿真世界模型中训练的策略,在真实世界遥控卡丁车竞速中能多大程度上泛化,且仅需极少的真实世界微调?
- RQ4人类示范与想象交互的结合是否能加速收敛并减少对专家干预的需求?
主要发现
- 在仿真环境中,DIRL的样本效率比先前方法高出1.8至8.4倍,显著减少了所需专家示范与真实世界轨迹采样的次数。
- DIRL(3 iter)在简单与困难任务中分别仅需1.33次与4.33次干预,优于先前版本,显著降低了对专家校正的依赖。
- 若移除不确定性估计(DIRL(-unc)),性能出现剧烈下降,在困难任务中分别达到154.5秒与32.67次干预,表明不确定性估计对策略安全至关重要。
- 在Reveries-net中训练的策略能良好泛化至真实世界遥控卡丁车竞速,实现对复杂障碍物与急转弯的敏捷、安全导航。
- 可视化结果表明,Reveries-net能准确预测未来状态,且在碰撞点附近表现出高不确定性,证明其在风险估计方面的可靠性。
- 尽管性能优异,DIRL在困难任务中仍比人类赛车手慢约10秒,表明策略架构与世界模型保真度仍有提升空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。