[论文解读] Learning by Cheating
本文提出了一种两阶段模仿学习框架,用于基于视觉的自动驾驶,其中一名拥有真实环境状态访问权限的‘作弊’特权智能体首先学习模仿专家轨迹,随后作为教师来训练一个纯视觉的感知-动作智能体。该方法在所有CARLA基准任务中实现了100%的成功率,并且与之前的工作相比,违规行为减少了整整一个数量级。
Vision-based urban driving is hard. The autonomous system needs to learn to perceive the world and act in it. We show that this challenging learning problem can be simplified by decomposing it into two stages. We first train an agent that has access to privileged information. This privileged agent cheats by observing the ground-truth layout of the environment and the positions of all traffic participants. In the second stage, the privileged agent acts as a teacher that trains a purely vision-based sensorimotor agent. The resulting sensorimotor agent does not have access to any privileged information and does not cheat. This two-stage training procedure is counter-intuitive at first, but has a number of important advantages that we analyze and empirically demonstrate. We use the presented approach to train a vision-based autonomous driving system that substantially outperforms the state of the art on the CARLA benchmark and the recent NoCrash benchmark. Our approach achieves, for the first time, 100% success rate on all tasks in the original CARLA benchmark, sets a new record on the NoCrash benchmark, and reduces the frequency of infractions by an order of magnitude compared to the prior state of the art. For the video that summarizes this work, see https://youtu.be/u9ZCxxD-UUw
研究动机与目标
- 解决从专家轨迹直接模仿学习以生成基于视觉的驾驶策略的困难。
- 通过解耦感知与控制学习,提升基于视觉的自动驾驶中的样本效率和泛化能力。
- 通过提供在线策略、多分支和白盒监督的特权教师,为感知-动作智能体提供强监督。
- 在推理阶段不依赖特权信息的前提下,实现在标准基准上的最先进性能。
- 证明基于仿真环境的特权训练可生成鲁棒且可迁移的基于视觉的策略,适用于真实世界部署。
提出的方法
- 使用真实环境状态(如鸟瞰图)和专家轨迹训练特权智能体,以学习鲁棒的控制策略。
- 在训练期间,将特权智能体作为教师,为基于视觉的感知-动作智能体提供高容量的在线策略监督。
- 通过在每个状态下查询特权智能体在所有可能指令(如左转、右转)下的动作,实现白盒监督,从而支持多分支训练。
- 采用在线DAgger风格的轨迹回放,利用感知-动作智能体的轨迹主动查询特权教师,以获取自适应监督。
- 基于特权智能体的中间表征(鸟瞰图)进行数据增强,以提升泛化能力。
- 使用具有多分支监督的离策略模仿学习训练感知-动作智能体,从而实现更好的动作输出去相关性。
实验结果
研究问题
- RQ1使用具有特权‘作弊’智能体的两阶段模仿学习方法,能否显著提升基于视觉的自动驾驶性能?
- RQ2与直接模仿学习相比,通过特权教师提供多分支、在线策略和白盒监督,是否能提升样本效率和泛化能力?
- RQ3该方法是否能在不依赖推理阶段特权信息的前提下,实现在CARLA和NoCrash等标准基准上的最先进性能?
- RQ4特权训练与仿真到真实世界的迁移相结合,如何实现基于视觉的智能体在真实世界中的鲁棒部署?
- RQ5特权教师生成多样化、自适应监督的能力在多大程度上能减少违规行为并提升安全指标?
主要发现
- 所提方法在原始CARLA基准的所有任务中均实现了100%的成功率,包括在新城镇和新天气条件下进行的全泛化设置。
- 在NoCrash基准中,该方法创下新纪录,所有条件下成功率均达到85%或以上,并在密集交通场景中将最先进水平提升了18个百分点。
- 与之前最先进方法(包括CILRS模型)相比,该方法将违规频率(如闯红灯和碰撞)至少降低了整整一个数量级。
- 违规行为分析显示,该方法在大多数条件下将闯红灯和碰撞行为减少至每10公里少于5起,其中Town 1和Town 1新天气条件下的违规数分别为3.1和3.2起/10公里。
- 白盒多分支监督与训练期间的在线轨迹回放相结合,可实现最佳性能,在所有条件下均达到100%成功率。
- 该方法表明,训练阶段使用特权信息不会损害最终基于视觉策略在真实世界中的适用性,因为其可通过标准的仿真到真实迁移技术进行转移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。