Skip to main content
QUICK REVIEW

[论文解读] Training a network to attend like human drivers saves it from common but misleading loss functions

Ye Xia, Danqing Zhang|arXiv (Cornell University)|Nov 17, 2017
Visual Attention and Saliency Detection被引用 8
一句话总结

该论文提出了一种新型的FCN-ConvLSTM模型,能够从单目行车记录仪视频中预测人类驾驶员的注意力,其性能优于SOTA方法,原因在于其学习了类似人类的注意力机制。该研究揭示了一个悖论:在驾驶数据上微调AlexNet会损害行人检测性能,原因在于帧的重要性不均等,为此提出了一种基于视觉注意力的非均匀帧采样方法,并引入自适应权重,从而提高了学习效率和性能。

ABSTRACT

We proposed a novel FCN-ConvLSTM model to predict multi-focal human driver's attention merely from monocular dash camera videos. Our model has surpassed the state-of-the-art performance and demonstrated sophisticated behaviors such as watching out for a driver exiting from a parked car. In addition, we have demonstrated a surprising paradox: fine-tuning AlexNet on a largescale driving dataset degraded its ability to register pedestrians. This is due to the fact that the commonly practiced training paradigm has failed to reflect the different importance levels of the frames of the driving video datasets. As a solution, we propose to unequally sample the learning frames at appropriate probabilities and introduced a way of using human gaze to determine the sampling weights. We demonstrated the effectiveness of this proposal in human driver attention prediction, which we believe can also be generalized to other driving-related machine learning tasks.

研究动机与目标

  • 开发一种深度学习模型,能够从单目行车记录仪视频中准确预测人类驾驶员的注意力。
  • 解决标准训练范式在驾驶数据集上微调时导致关键任务(如行人检测)性能下降的悖论。
  • 识别出驾驶视频中帧的重要性并非均匀分布,从而挑战了训练过程中帧采样均等化的假设。
  • 提出一种基于人类视觉注意力数据加权的帧采样策略,以反映视频帧的差异性重要性。
  • 将此采样方法推广至其他与驾驶相关的机器学习任务,以提升整体性能。

提出的方法

  • 提出一种FCN-ConvLSTM架构,用于建模视频输入中驾驶员注意力的时空动态特性。
  • 引入一种非均匀帧采样策略,其中采样概率由人类视觉注意力数据决定,以反映帧的重要性。
  • 利用人类视觉注意力标注计算采样权重,优先选择注意力密度较高的帧。
  • 使用加权样本进行模型训练,以更好地捕捉如行人横穿等关键视觉事件。
  • 采用反映帧相对重要性的损失函数,降低低注意力帧带来的误导性信号。
  • 在大规模驾驶数据集上验证该方法,证明其在注意力预测性能和鲁棒性方面均有提升。

实验结果

研究问题

  • RQ1为何在大规模驾驶数据集上微调AlexNet会导致其行人检测能力下降?
  • RQ2驾驶视频中帧的重要性不均等,如何影响标准训练范式?
  • RQ3能否利用人类视觉注意力数据来定义最优的帧采样概率,以提升模型学习效果?
  • RQ4基于视觉注意力的非均匀采样是否相比均匀采样能显著提升注意力预测性能?
  • RQ5该采样策略是否可推广至其他与驾驶相关的机器学习任务?

主要发现

  • 在大规模驾驶数据集上微调AlexNet导致行人检测性能出现可测量的下降,揭示了标准训练方法中的关键缺陷。
  • 所提出的基于人类视觉注意力的非均匀帧采样策略,在注意力预测性能上显著优于均匀采样。
  • 该模型成功捕捉了复杂的驾驶员行为,如留意 parked 车辆后方驶出的车辆,表明其具备高层次注意力建模能力。
  • 基于视觉注意力的加权采样方法降低了低注意力帧的影响,从而在训练过程中最小化了误导性信号。
  • 该方法展现出良好的泛化潜力,表明其可适用于自动驾驶中的其他视觉任务。
  • FCN-ConvLSTM模型在基准数据集上实现了人类驾驶员注意力预测的SOTA性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。