Skip to main content
QUICK REVIEW

[论文解读] Learning Gaze Transitions from Depth to Improve Video Saliency Estimation

George Leifman, Dmitry Rudoy|arXiv (Cornell University)|Mar 11, 2016
Visual Attention and Saliency Detection参考文献 16被引用 4
一句话总结

本文提出了一种深度感知的视频显著性模型,利用生成式卷积神经网络,通过建模从一帧到下一帧的注视转移,结合RGB和深度输入来预测显著性图。该方法通过学习深度对视觉注意的复杂、上下文依赖性影响,在一个新的RGBD视频眼动追踪数据集(DAViS)上实现了相比最先进方法15%的相对性能提升。

ABSTRACT

In this paper we introduce a novel Depth-Aware Video Saliency approach to predict human focus of attention when viewing RGBD videos on regular 2D screens. We train a generative convolutional neural network which predicts a saliency map for a frame, given the fixation map of the previous frame. Saliency estimation in this scenario is highly important since in the near future 3D video content will be easily acquired and yet hard to display. This can be explained, on the one hand, by the dramatic improvement of 3D-capable acquisition equipment. On the other hand, despite the considerable progress in 3D display technologies, most of the 3D displays are still expensive and require wearing special glasses. To evaluate the performance of our approach, we present a new comprehensive database of eye-fixation ground-truth for RGBD videos. Our experiments indicate that integrating depth into video saliency calculation is beneficial. We demonstrate that our approach outperforms state-of-the-art methods for video saliency, achieving 15% relative improvement.

研究动机与目标

  • 解决在2D屏幕上显示3D视频内容时预测人类视觉注意的挑战,此时存在深度信息但未被渲染。
  • 通过从数据中学习而非应用固定先验,克服深度如何影响显著性的模糊性——即在不同上下文中,近处或远处的物体可能更显著。
  • 构建一个包含真实眼动固定点数据的RGBD视频综合数据集,以支持对深度感知显著性模型的可靠评估。
  • 证明将深度整合到基于学习的显著性框架中,相比忽略深度或使用简单启发式方法的模型,能提升准确性和鲁棒性。

提出的方法

  • 训练一个生成式卷积神经网络,基于前一帧的显著性图以及当前的RGB和深度输入,预测当前帧的显著性图。
  • 采用类似循环的结构,使网络能够建模帧间注视转移,隐式学习视觉和深度线索引发的动态注意转移。
  • 将深度作为关键输入模态,使网络能够学习深度与显著性之间的上下文特定关系,而非应用固定规则(例如“更近的物体更显著”)。
  • 利用一个新数据集(DAViS),包含54个RGBD视频和在2D屏幕上观看视频时收集的眼动追踪数据,忽略深度以模拟真实世界条件。
  • 在38个视频上进行训练,在16个未见过的视频上进行测试,使用定量指标(χ²和AUC)和定性视觉对比评估性能。
  • 与一个将深度信息整合到先前最先进方法(Rudoy等人[38])的基线进行比较,并通过从输入中移除深度来消融分析其贡献。

实验结果

研究问题

  • RQ1将深度信息整合到基于学习的视频显著性模型中,与忽略深度的方法相比,是否能显著提升预测准确性?
  • RQ2生成式CNN是否能有效利用RGB、深度和前一帧显著性图来建模连续视频帧之间的注视转移?
  • RQ3在真实世界视频内容中,深度对显著性的影响是什么?这种影响是否因场景上下文(例如特写与远距离物体)而异?
  • RQ4基于学习的方法在视频显著性估计中,与启发式或非学习方法的深度整合相比,其性能优势有多大?
  • RQ5该方法在多样化视频内容中的可靠性与一致性如何?与基线方法相比,其方差和鲁棒性表现如何?

主要发现

  • 所提出的深度感知视频显著性模型在χ²和AUC指标上,相比最先进方法(Rudoy等人[38])实现了15%的相对性能提升。
  • 该模型的性能显著更接近真实眼动图,优于所有基线方法,包括图像显著性(GBVS[10])和深度感知图像显著性(RGBD[35])。
  • 与其他所有方法相比,该方法在测试视频上的标准差更低,表明其显著性预测具有更高的可靠性和一致性。
  • 从输入中移除深度会导致性能明显下降,证实深度是实现准确显著性预测的关键且有益的输入。
  • 定性结果表明,该模型能准确捕捉动态注视转移,例如在两人对话中注意力在人脸之间切换,而其他方法无法正确建模这种行为。
  • 本文引入的DAViS数据集为未来深度感知视频显著性研究提供了全面的基准,包含54个RGBD视频和在真实2D显示条件下收集的眼动追踪数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。