[论文解读] Agile Autonomous Driving using End-to-End Deep Imitation Learning
本文提出了一种仅使用低成本车载传感器(单目摄像头和轮速传感器)的端到端深度模仿学习系统,用于高速非铺装路面自主驾驶。通过利用在线模仿学习模仿模型预测控制器,该方法在无需状态估计或在线规划的情况下,实现了最先进性能——最高时速达144 km/h,并且在分布移位方面相比批量模仿学习展现出更优的鲁棒性。
We present an end-to-end imitation learning system for agile, off-road autonomous driving using only low-cost sensors. By imitating a model predictive controller equipped with advanced sensors, we train a deep neural network control policy to map raw, high-dimensional observations to continuous steering and throttle commands. Compared with recent approaches to similar tasks, our method requires neither state estimation nor on-the-fly planning to navigate the vehicle. Our approach relies on, and experimentally validates, recent imitation learning theory. Empirically, we show that policies trained with online imitation learning overcome well-known challenges related to covariate shift and generalize better than policies trained with batch imitation learning. Built on these insights, our autonomous driving system demonstrates successful high-speed off-road driving, matching the state-of-the-art performance.
研究动机与目标
- 开发一种仅使用车载传感器的低成本、端到端自主驾驶系统,用于高速非铺装路面导航。
- 克服传统“建模-规划-执行”方法在复杂、不确定环境中应用的局限性。
- 通过模仿学习训练一种反射式控制策略,减少对昂贵传感器和在线规划的依赖。
- 研究并缓解模仿学习在真实机器人控制中面临的分布移位问题。
- 验证在线模仿学习在高速驾驶场景中相比批量模仿学习具有更好的泛化能力。
提出的方法
- 该系统使用深度神经网络(DNN)策略,将原始的高维观测值(单目图像和轮速)直接映射为连续的转向和油门指令。
- 专家示范由具备高精度GPS和IMU的模型预测控制器(MPC)生成,作为黑箱专家。
- 采用在线模仿学习,即在滚动执行过程中实时使用专家动作更新策略,从而减少分布移位。
- 将批量模仿学习作为基线进行比较,即在固定专家示范数据集上训练策略。
- 使用t-SNE可视化DNN最后一层隐藏层的特征,以分析训练数据与测试数据之间的分布偏移。
- 该方法引入轮速输入以推断隐藏的车辆状态,从而在不使用循环网络的情况下实现横向与纵向控制的联合控制。
实验结果
研究问题
- RQ1仅使用低成本车载传感器的端到端深度模仿学习系统能否实现高速非铺装路面驾驶性能?
- RQ2在不同策略执行导致的分布移位背景下,在线模仿学习是否比批量模仿学习具有更好的泛化能力?
- RQ3通过模仿学习训练的DNN策略是否能在无需状态估计或在线规划的情况下,达到高精度MPC控制器的性能?
- RQ4在原始图像和轮速分布偏移下,DNN策略的特征表示在在线与批量IL之间有何差异?
- RQ5轮速输入对策略推断车辆状态并实现有效控制的能力有何贡献?
主要发现
- 通过在线模仿学习训练的DNN策略在真实非铺装路面实验中实现了约6 m/s的平均速度和约8 m/s的最高速度(全尺寸下为108 km/h和144 km/h)。
- 该系统在无需昂贵传感器或在线规划的情况下,达到了先前基于MPC方法的最先进性能水平。
- 在线IL显著降低了分布移位的影响,表现为DNN最后一层隐藏层的特征分布在训练和测试数据之间更加一致。
- 相比之下,批量IL未能学习到一致的特征嵌入,导致泛化能力较差,并在复杂场景下表现不佳。
- 引入轮速输入后,策略性能优于仅使用CNN的基线模型,表明DNN能够从传感器输入中推断出隐藏的车辆状态。
- DNN的特征图显示,网络能自动检测出关键的赛道边界和结构特征,同时忽略草丛和泥土等不相关特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。