Skip to main content
QUICK REVIEW

[论文解读] Learning a CNN-based End-to-End Controller for a Formula SAE Racecar

Skanda Koppula|arXiv (Cornell University)|Jul 12, 2017
Autonomous Vehicle Technology and Safety参考文献 3被引用 6
一句话总结

本文提出了一种基于CNN的端到端控制器,用于公式SAE赛车,利用摄像头输入实时预测转向、制动和油门操作。该方法在离散化转向分类中实现了95.5%的验证准确率,并展示了适合实时控制的低延迟推理性能,初步实现了连续转向值的预测,并提出了制动/油门预测的架构设计。

ABSTRACT

We present a set of CNN-based end-to-end models for controls of a Formula SAE racecar, along with various benchmarking and visualization tools to understand model performance. We tackled three main problems in the context of cone-delineated racetrack driving: (1) discretized steering, which translates a first-person frame along to the track to a predicted steering direction. (2) real-value steering, which translates a frame view to a real-value steering angle, and (3) a network design for predicting brake and throttle. We demonstrate high accuracy on our discretization task, low theoretical testing errors with our model for real-value steering, and a starting point for future work regarding a controller for our vehicle's brake and throttle. Timing benchmarks suggests that the networks we propose have the latency and throughput required for real-time controllers, when run on GPU-enabled hardware.

研究动机与目标

  • 开发一种基于CNN的端到端控制器,用于在锥桶标记赛道上实现公式SAE赛车的自主导航。
  • 通过数据增强和稳健的模型设计,解决有限训练数据带来的挑战,防止误差累积。
  • 实现适合在GPU硬件上实时控制的低延迟推理。
  • 将控制器扩展至预测连续转向角度,并构建制动/油门控制的框架。
  • 利用同步的视频与驾驶状态数据验证模型性能,并通过视觉仿真进行误差分析。

提出的方法

  • 从三名人类驾驶员在400米锥桶赛道上的驾驶中,采集了12,097帧同步的图像与驾驶状态数据(转向、制动、油门、电机转速)。
  • 将视频帧裁剪并缩放为256×256,以降低维度和内存使用量,数据集按60%训练、20%验证、20%测试进行划分。
  • 训练了多种CNN架构(1CL-1FC至3CL-2FC)用于离散化转向分类(左/直行/右),采用批量归一化和ReLU激活函数。
  • 将模型扩展用于预测真实值转向角度,采用回归头并使用L1损失;设计了多输入DAG架构,结合视频和电机转速输入,用于制动/油门预测。
  • 应用基于图像转换的数据增强技术,模拟非居中驾驶情况,提升对视角偏移的鲁棒性。
  • 使用Torch在GPU集群上进行训练,并利用视觉仿真工具验证预测动作与赛道几何结构的一致性。

实验结果

研究问题

  • RQ1基于CNN的端到端控制器能否仅通过视觉输入和有限的真实世界驾驶数据,学会控制公式SAE赛车的转向?
  • RQ2在离散化与真实值转向预测之间,模型性能如何变化?其在准确率与延迟之间的权衡是什么?
  • RQ3通过图像转换进行数据增强,能否提升泛化能力并减少非居中驾驶场景下的误差累积?
  • RQ4何种架构设计能够有效结合视觉和运动状态输入,实现制动与油门动作的联合预测?
  • RQ5该控制器能否实现足够低的推理延迟,以实现在嵌入式GPU硬件上的实时部署?

主要发现

  • 离散化转向模型在验证集上达到95.5%的准确率,证明了在小数据集上实现端到端学习的可行性。
  • 真实值转向模型的平均L1验证损失为1.4,表明其在预测连续转向角度时具有高精度。
  • 采用图像转换进行数据增强后,混合测试集上的验证损失从18.1降至7.4,表明对非居中驾驶场景的鲁棒性显著提升。
  • 所提出的制动/油门控制器架构采用具有视频和电机转速输入的多父节点DAG结构,通过缩放Sigmoid输出实现联合预测。
  • 时序基准测试表明,所提出的模型具有极低的端到端延迟,适合在GPU硬件上实现实时部署。
  • 视觉仿真显示,仅逐帧预测转向行为会导致不稳定表现,凸显了采用循环或概率方法以防止误差累积的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。