Skip to main content
QUICK REVIEW

[论文解读] ATSal: An Attention Based Architecture for Saliency Prediction in 360 Videos

Yasser Dahou, Marouane Tliba|arXiv (Cornell University)|Nov 20, 2020
Visual Attention and Saliency Detection参考文献 43被引用 8
一句话总结

ATSal 提出了一种新颖的双流注意力机制,用于360°视频显著性预测,通过注意力模块结合全局上下文特征,并利用局部图像块级别的专家模型提升空间与时间建模能力。该方法在Salient360!和VR-EyeTracking数据集上实现了最先进性能,所有指标均优于现有方法,同时保持高效的推理速度。

ABSTRACT

The spherical domain representation of 360 video/image presents many challenges related to the storage, processing, transmission and rendering of omnidirectional videos (ODV). Models of human visual attention can be used so that only a single viewport is rendered at a time, which is important when developing systems that allow users to explore ODV with head mounted displays (HMD). Accordingly, researchers have proposed various saliency models for 360 video/images. This paper proposes ATSal, a novel attention based (head-eye) saliency model for 360\degree videos. The attention mechanism explicitly encodes global static visual attention allowing expert models to focus on learning the saliency on local patches throughout consecutive frames. We compare the proposed approach to other state-of-the-art saliency models on two datasets: Salient360! and VR-EyeTracking. Experimental results on over 80 ODV videos (75K+ frames) show that the proposed method outperforms the existing state-of-the-art.

研究动机与目标

  • 为利用深度学习预测360°视频中的人类头部与眼球注视点分布模式提供解决方案。
  • 通过显式建模球面域中的全局视觉注意力,提升显著性预测性能。
  • 通过在连续帧的图像块表示上应用专家模型,增强局部特征学习能力。
  • 提供一种计算效率高的架构,适用于虚拟现实流媒体等实时应用场景。
  • 发布VR-EyeTracking数据集的预处理注视点图,以支持未来研究。

提出的方法

  • 该模型采用双流架构:一条路径通过扩大感受野的自注意力机制处理全局特征,以编码上下文空间信息。
  • 第二条路径利用专家模型在局部图像块上学习显著性,通过逐像素乘法对预测结果进行优化,以抑制过估计。
  • 对时间特征应用指数移动平均(EMA),以建模视频帧间运动动态。
  • 将注意力模块插入瓶颈层,以将全局上下文信息传播至所有空间位置,提升特征表示能力。
  • 网络在静态360°图像上进行预训练,并在视频数据上进行微调,以提升泛化能力。
  • 最终显著性图通过融合注意力调制的全局特征与基于专家的局部预测生成。

实验结果

研究问题

  • RQ1一种建模全局视觉上下文的注意力机制是否能提升360°视频中的显著性预测性能?
  • RQ2将全局注意力与局部专家模型结合,对360°视频显著性基准测试的性能有何影响?
  • RQ3所提出的架构在不同类型的360°视频内容与注视模式下,其泛化能力如何?
  • RQ4与现有360°显著性模型相比,该模型的推理速度如何,特别是在实时应用中的表现?
  • RQ5通过EMA集成时间动态是否能提升显著性预测的时间一致性?

主要发现

  • ATSal在Salient360!和VR-EyeTracking数据集上的所有五项评估指标(包括AUC-J、NSS、EMD和MAE)均优于所有对比模型。
  • 在Salient360!数据集上,ATSal在准确性方面展现出显著的定量优势,尤其在视频序列中表现突出,体现出在多样化场景下的鲁棒性。
  • 即使在不使用专家流的情况下,模型仍保持高性能,表明仅靠全局注意力机制本身已具备强大能力。
  • 在VR-EyeTracking基准测试中,ATSal的推理速度比Two-stream模型快逾9倍,单帧推理时间仅为0.230秒(NVIDIA GTX 1080)。
  • 定性结果表明,ATSal生成的显著性图更准确、更完整,能紧密匹配真实分布,避免赤道偏差。
  • 注意力模块与专家模块的融合使显著性区域更加聚焦且一致,相比基线模型显著减少了过估计现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。