[论文解读] Imitation Learning for End to End Vehicle Longitudinal Control with Forward Camera
本文提出了一种仅使用前向摄像头和基于LSTM的神经网络的端到端模仿学习系统,用于车辆纵向速度控制。该系统引入了一种新颖的数据与标签增强流程,结合自定义平滑损失函数,实现了在模拟环境和具有挑战性的测试跑道上的真实世界测试中,仅需极少人工干预的鲁棒速度预测。
In this paper we present a complete study of an end-to-end imitation learning system for speed control of a real car, based on a neural network with a Long Short Term Memory (LSTM). To achieve robustness and generalization from expert demonstrations, we propose data augmentation and label augmentation that are relevant for imitation learning in longitudinal control context. Based on front camera image only, our system is able to correctly control the speed of a car in simulation environment, and in a real car on a challenging test track. The system also shows promising results in open road context.
研究动机与目标
- 开发一种仅使用前向摄像头输入的完整端到端模仿学习系统,用于车辆速度控制。
- 通过定制化的数据与标签增强方法,解决模仿学习在纵向控制中出现的分布偏移和泛化问题。
- 通过引入时间差分平滑损失函数,确保控制过程平滑且类人。
- 在模拟环境(GTA V)和复杂城市测试跑道的真实世界测试中验证系统性能。
- 在实际驾驶场景中实现在线、实时运行,且仅需极少人工干预。
提出的方法
- 一个包含7个卷积层、3个全连接层和1个LSTM层的11层深度神经网络,处理320x240归一化前向摄像头图像,以预测期望速度。
- 通过带有模糊增益自适应的PID控制器将网络输出转换为加速度指令。
- 自定义损失函数结合了均方误差(MSE)、时间差分平滑损失 $L_p$ 和L2正则化,以确保控制动态的平滑性。
- 平滑损失 $L_p = \sum_{t=1}^{N} \left[ Y(t) - Y(t-1) \right] - \left[ \hat{Y}(t) - \hat{Y}(t-1) \right]$ 最小化预测与专家速度变化之间的差异。
- 数据增强包括合成图像变换和标签扰动,以模拟偏离专家轨迹的情况,从而提升鲁棒性。
- 训练数据来自模拟环境(GTA V)和真实世界驾驶(巴黎开放道路以及配备动态障碍物和之字形弯道的专用测试跑道)
实验结果
研究问题
- RQ1仅使用前向摄像头输入的端到端模仿学习系统,能否在真实世界驾驶中实现鲁棒且平滑的纵向速度控制?
- RQ2在纵向控制的在线推理过程中,标签和数据增强在缓解分布偏移方面的有效性如何?
- RQ3时间差分平滑损失对控制平滑性和系统性能的影响是什么?
- RQ4该系统能否泛化到复杂动态场景,如障碍物前的启停和急转弯?
- RQ5系统在模拟环境、开放道路和专用测试跑道环境中的性能表现如何比较?
主要发现
- 在专用测试跑道上,使用LSTM与 $L_p$ 损失的系统实现了1.17 km/h的速度平均绝对误差(MAE)和0.02 m/s²的加速度MAE。
- 该系统在CES 2018的现场演示中表现出高度可靠性,多圈行驶中平均每天空仅需约一次人工干预。
- 可视化反向传播分析表明,网络在制动时会聚焦于停车标志、障碍物和前车等关键道路元素。
- 在开放道路数据上,系统实现了6.40 km/h的速度MAE,表明在一般城市环境中仍有改进空间。
- 所提出的 $L_p$ 损失显著提升了控制平滑性,与基线LSTM和普通网络相比,加速度MAE明显降低。
- 数据增强、标签增强与自定义损失函数的结合,使系统在物理车辆上实现了仅需极少人工监督的实时控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。