Skip to main content
QUICK REVIEW

[论文解读] See, Attend and Brake: An Attention-based Saliency Map Prediction Model for End-to-End Driving

Ekrem Aksoy, Ahmet Yazıcı|arXiv (Cornell University)|Feb 24, 2020
Visual Attention and Saliency Detection参考文献 37被引用 10
一句话总结

该论文提出了一种用于自动驾驶的端到端注意力驱动显著性图预测模型,将视觉注意与制动决策相结合。通过使用基于VGG-16和ConvLSTM的驾驶员注意力模块,并引入可学习的RBF先验,该模型能够预测显著性图以指导制动决策,在BDD-A数据集上实现了AUC=0.540的性能,尽管高斯先验在驾驶数据集上表现不佳,但其性能仍优于基线模型。

ABSTRACT

Visual perception is the most critical input for driving decisions. In this study, our aim is to understand relationship between saliency and driving decisions. We present a novel attention-based saliency map prediction model for making braking decisions This approach constructs a holistic model to the driving task and can be extended for other driving decisions like steering and acceleration. The proposed model is a deep neural network model that feeds extracted features from input image to a recurrent neural network with an attention mechanism. Then predicted saliency map is used to make braking decision. We trained and evaluated using driving attention dataset BDD-A, and saliency dataset CAT2000.

研究动机与目标

  • 通过针对驾驶任务定制的注意力机制,建模自动驾驶中的驾驶员特定视觉显著性。
  • 探究显著性图预测与实际驾驶决策(尤其是制动)之间的关系。
  • 开发一种整体性感知框架,将显著性预测直接整合到决策过程中,减少对任务特定组件的依赖。
  • 评估在驾驶场景下不同中心偏置先验(高斯与可学习RBF)的有效性。
  • 将显著性预测模型从静态图像扩展到序列化、任务驱动的驾驶视频数据。

提出的方法

  • 模型使用带有空洞卷积的VGG-16主干网络,从输入图像中提取空间特征。
  • 基于ConvLSTM的循环网络处理序列特征,并在每个时间步对LSTM隐藏状态应用注意力机制。
  • 注意力机制根据驾驶上下文动态加权相关空间区域,聚焦于车辆、行人和交通灯等显著物体。
  • 通过径向基函数(RBF)引入可学习的中心偏置先验,并在训练过程中端到端优化。
  • 决策模块利用预测的显著性图对制动行为进行分类,性能通过在新扩充的BDD-A数据集上计算AUC进行评估。
  • 模型使用皮尔逊相关系数(CC)和Kullback-Leibler(KL)散度损失联合训练,以优化显著性图的准确性。

实验结果

研究问题

  • RQ1当在驾驶视频序列而非静态图像上进行训练时,基于注意力的显著性预测模型表现如何?
  • RQ2在驾驶特定的显著性预测任务中,可学习的RBF先验是否优于标准的高斯先验?
  • RQ3在真实驾驶场景中,显著性图预测是否与实际制动事件存在相关性?
  • RQ4为何在CAT2000数据集上表现良好的高斯中心偏置先验在BDD-A驾驶数据集上表现失败?
  • RQ5统一的显著性预测模型能否有效支持端到端的驾驶决策,如制动、转向或加速?

主要发现

  • 所提出的模型在BDD-A数据集上的KL散度(0.4607 vs. 1.24)优于基线DAVE-2模型,表明其显著性图预测准确性更高。
  • 基于RBF的先验(32个组件)在BDD-A上实现了最佳的显著性预测性能,优于高斯先验和无先验基线。
  • 高斯中心偏置先验在BDD-A上表现严重失败,可能是因为该数据集的显著性分布并非中心偏置,与CAT2000不同。
  • 基于显著性图的制动决策模型在扩充的BDD-A数据集上实现了AUC=0.540,表明其与实际制动事件存在微弱但有意义的相关性。
  • 即使不使用中心偏置先验的模型,其性能也优于使用高斯先验的模型,表明先验设计必须根据数据分布进行调整。
  • 该模型证明注意力机制可有效应用于视频序列中LSTM输出的驾驶上下文建模,显著提升了显著性预测性能,优于标准基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。