Skip to main content
QUICK REVIEW

[论文解读] Periphery-Fovea Multi-Resolution Driving Model guided by Human Attention

Ye Xia, Jinkyu Kim|arXiv (Cornell University)|Mar 24, 2019
Video Surveillance and Tracking Methods参考文献 20被引用 5
一句话总结

该论文提出了一种基于人眼视觉机制的周边-中央多分辨率驱动模型,通过使用低分辨率周边输入和由预测的人类注视位置引导的高分辨率中央输入来模拟人类视觉。在相同计算量(FLOP预算)下,与单一分辨率模型相比,该模型在行人相关的关键驾驶场景中显著提升了驱动精度,证明了人类注视监督可有效提升高风险驾驶场景下的模型性能。

ABSTRACT

Inspired by human vision, we propose a new periphery-fovea multi-resolution driving model that predicts vehicle speed from dash camera videos. The peripheral vision module of the model processes the full video frames in low resolution. Its foveal vision module selects sub-regions and uses high-resolution input from those regions to improve its driving performance. We train the fovea selection module with supervision from driver gaze. We show that adding high-resolution input from predicted human driver gaze locations significantly improves the driving accuracy of the model. Our periphery-fovea multi-resolution model outperforms a uni-resolution periphery-only model that has the same amount of floating-point operations. More importantly, we demonstrate that our driving model achieves a significantly higher performance gain in pedestrian-involved critical situations than in other non-critical situations.

研究动机与目标

  • 开发一种模仿人类视觉多分辨率结构的驾驶模型,其中周边区域采用低分辨率处理,中央区域采用高分辨率处理。
  • 通过使用预测的人类注视位置引导中央视觉关注显著区域,而非依赖强化学习,以提升驾驶性能。
  • 评估在关键驾驶场景(如行人相遇)中引入人类注视是否能提升模型精度。
  • 在相同计算约束(FLOPs)下,比较多分辨率中央-周边模型与单一分辨率仅周边模型的性能表现。

提出的方法

  • 模型使用全帧低分辨率输入作为周边视觉,通过注视预测头预测人类驾驶员的注视位置。
  • 从预测的注视位置提取高分辨率图像块,作为增强局部细节处理的中央输入。
  • 将周边和中央特征融合后输入共享规划器,以预测车辆速度,其中中央区域选择由真实驾驶员注视数据监督。
  • 模型采用端到端训练,损失函数旨在最小化速度预测误差,同时注视预测头使用人类注视标注进行训练。
  • 通过测试集上的平均绝对误差(MAE)评估性能,并利用置换检验来考虑视频帧之间的时序相关性,以评估统计显著性。
  • 构建一个与多分辨率模型具有相同FLOP数量的基线单一分辨率仅周边模型,以实现公平比较。

实验结果

研究问题

  • RQ1在相同计算成本下,基于预测人类注视引导的多分辨率驾驶模型是否能实现比单一分辨率仅周边模型更高的精度?
  • RQ2与非关键场景相比,在涉及行人的关键驾驶场景中,引入人类注视是否能更显著地提升模型性能?
  • RQ3当在不同长度的视频片段上测试时,中央-周边模型的性能与中等分辨率仅周边模型相比如何?
  • RQ4在高紧急程度场景中,来自中央视觉的性能增益是否更为显著,这是否与数据集中文本标注的紧急程度说明一致?

主要发现

  • 在相同FLOP预算下,周边-中央多分辨率模型的预测误差显著低于单一分辨率仅周边模型,证明了其更高的效率与精度。
  • 在涉及行人的关键驾驶场景中,该模型表现出统计显著的性能提升(p = 0.002),且误差减少幅度大于非关键场景。
  • 中等分辨率仅周边模型的预测误差随视频片段长度增加而持续上升,而多分辨率模型在所有片段长度下均保持稳定且更低的误差。
  • 在所有测试的视频长度下,该模型的平均绝对误差(MAE)均持续低于基线,且FLOP使用量完全相同。
  • 在高紧急程度场景中,中央视觉带来的性能增益最为显著,表明人类注视引导可有效增强关键驾驶时刻的决策能力。
  • 使用低分辨率输入进行注视预测,可在保证高精度中央处理的同时,实现高效的实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。