Skip to main content
QUICK REVIEW

[论文解读] Two-stream convolutional networks for end-to-end learning of self-driving cars

Nelson Fernández|arXiv (Cornell University)|Nov 13, 2018
Autonomous Vehicle Technology and Safety参考文献 13被引用 10
一句话总结

该论文提出了一种双流2D-CNN架构,通过联合学习原始图像的空间特征和光流的时间特征,以提升端到端自动驾驶汽车方向盘转向预测的性能。通过使用先前转向角作为辅助任务的多任务学习,该模型在Comma.ai数据集上相比基线回归方法实现了30%的准确率和稳定性的提升,其白噪声水平降低至4.97度/时间——更接近人类驾驶行为。

ABSTRACT

We propose a methodology to extend the concept of Two-Stream Convolutional Networks to perform end-to-end learning for self-driving cars with temporal cues. The system has the ability to learn spatiotemporal features by simultaneously mapping raw images and pre-calculated optical flows directly to steering commands. Although optical flows encode temporal-rich information, we found that 2D-CNNs are prone to capturing features only as spatial representations. We show how the use of Multitask Learning favors the learning of temporal features via inductive transfer from a shared spatiotemporal representation. Preliminary results demonstrate a competitive improvement of 30% in prediction accuracy and stability compared to widely used regression methods trained on the Comma.ai dataset.

研究动机与目标

  • 为解决单帧回归在自动驾驶中的局限性,通过引入时间动态信息。
  • 探究2D-CNN是否能有效从光流表示中学习时间特征,以实现端到端的转向预测。
  • 评估多任务学习在通过归纳迁移改善时间泛化能力方面的有效性。
  • 在Comma.ai数据集上,将所提出的双流架构与最先进2D-CNN回归模型进行基准对比。
  • 证明通过逐元素相乘实现的共享时空表征可增强特征融合与预测稳定性。

提出的方法

  • 该模型采用两个相同的2D-CNN分支:一个处理原始RGB图像以提取空间特征,另一个处理预计算的光流以捕捉时间运动线索。
  • 对每个流的最后卷积层应用全局平均池化,以减少参数量并防止过拟合。
  • 通过逐元素相乘将两个流的嵌入表示融合,生成共享的时空表征。
  • 使用带有线性输出的多层感知机(MLP)执行回归,以预测当前转向角。
  • 通过同时预测当前和前一帧的转向角来实施多任务学习,其中前一帧转向角仅在训练阶段使用。
  • 采用两阶段训练策略:首先独立预训练每个流;其次,对整个网络进行微调,重点优化最终的回归头。

实验结果

研究问题

  • RQ12D-CNN能否在端到端自动驾驶系统中有效从光流表示中学习时间特征?
  • RQ2通过共享时空表征融合空间与时间流,是否能提升回归的准确率与稳定性?
  • RQ3以先前转向角作为辅助任务的多任务学习,在多大程度上能增强时间泛化能力?
  • RQ4所提出的双流架构在性能上与仅基于原始图像或光流训练的单流2D-CNN相比如何?
  • RQ5结合光流与多任务学习是否能降低预测偏差,并改善转向指令的白噪声水平(时间平滑性)?

主要发现

  • 双流卷积网络在Comma.ai测试集上实现了12.52度的RMSE,相比基线回归方法准确率提升了30%。
  • 该模型的白噪声水平降低至4.97度/时间,显著接近人类驾驶员的4.36度/时间,表明转向预测更加平滑。
  • 仅使用光流进行训练相比原始图像可提升30%的准确率(RMSE 14.21 vs. 20.55 for Simple-CNN),但未改善白噪声水平,表明仅学习空间特征存在局限。
  • 所提出的架构优于最先进模型,包括Comma.ai的2D-CNN(RMSE 23.99)和Nvidia PilotNet(RMSE 20.55)。
  • 通过将先前转向角作为辅助任务的多任务学习,实现了归纳迁移,纠正了时间偏差并提升了预测稳定性。
  • 散点图分析表明,与单流模型相比,双流模型在空间和时间维度上均显著降低了偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。