[论文解读] ASOD60K: An Audio-Induced Salient Object Detection Dataset for Panoramic Videos
本文提出了 ASOD60K,这是首个用于360°全景视频中音频诱导显著性物体检测(SOD)的大规模数据集,包含4K分辨率的图像帧,具有分层的、由粗到精的标注,包括眼动追踪、边界框、实例掩码以及几何失真等属性。该数据集使11种最先进模型的基准测试成为可能,揭示了音频线索显著提升了显著性预测的一致性,而当前模型在复杂属性和长距离扫描路径建模方面仍存在困难。
Exploring to what humans pay attention in dynamic panoramic scenes is useful for many fundamental applications, including augmented reality (AR) in retail, AR-powered recruitment, and visual language navigation. With this goal in mind, we propose PV-SOD, a new task that aims to segment salient objects from panoramic videos. In contrast to existing fixation-/object-level saliency detection tasks, we focus on audio-induced salient object detection (SOD), where the salient objects are labeled with the guidance of audio-induced eye movements. To support this task, we collect the first large-scale dataset, named ASOD60K, which contains 4K-resolution video frames annotated with a six-level hierarchy, thus distinguishing itself with richness, diversity and quality. Specifically, each sequence is marked with both its super-/sub-class, with objects of each sub-class being further annotated with human eye fixations, bounding boxes, object-/instance-level masks, and associated attributes (e.g., geometrical distortion). These coarse-to-fine annotations enable detailed analysis for PV-SOD modelling, e.g., determining the major challenges for existing SOD models, and predicting scanpaths to study the long-term eye fixation behaviors of humans. We systematically benchmark 11 representative approaches on ASOD60K and derive several interesting findings. We hope this study could serve as a good starting point for advancing SOD research towards panoramic videos. The dataset and benchmark will be made publicly available at https://github.com/PanoAsh/ASOD60K.
研究动机与目标
- 解决缺乏大规模、高质量的全景视频显著性物体检测数据集的问题,这些数据集需整合音视频线索。
- 研究音频如何影响沉浸式360°场景中的人类注意力,特别是通过眼动追踪模式。
- 为基于丰富、多层次标注的全景视频数据,开发显著性物体检测模型的基准测试。
- 识别当前SOD模型在应用于全景视频时面临的关键挑战,尤其是针对特定属性的性能和扫描路径预测。
- 通过建模动态全景环境中的人类注意力,为增强现实/虚拟现实(AR/VR)应用(如视觉语言导航、沉浸式游戏和智能零售)提供基础。
提出的方法
- 作者使用头戴式显示器(HMD)及其内置眼动追踪器,从360°场景中收集了60,000张高分辨率(4K)全景视频帧,记录受试者在自然观看过程中的眼动轨迹。
- 每个视频序列均使用六级分层类别系统进行标注,包括超类和子类标签,以实现细粒度的语义理解。
- 针对每一帧,作者提供了由粗到精的标注:头部运动(HM)、眼动追踪、边界框、物体级和实例级掩码,以及几何失真(GD)、遮挡和运动模糊等属性。
- 标注过程由多位专家和志愿者交叉核对,以确保所有标签具有高可靠性、准确性和一致性。
- 利用该数据集对11种最先进SOD模型在多个指标上进行了基准测试:$S_{\alpha}$、$E_{\phi}^{\text{max}}$、$E_{\phi}^{\text{mean}}$ 和 $\mathcal{M}$,性能按视频序列和属性分别分析。
- 研究评估了模型的整体性能和属性特定性能,揭示了性能差距以及关于模型泛化能力和失效模式的洞察。
实验结果
研究问题
- RQ1音频如何通过跨受试者眼动一致性来影响全景视频中的人类注意力?
- RQ2现有SOD模型在复杂全局几何结构和音视频动态的全景视频数据上,其泛化能力如何?
- RQ3当前SOD模型在全景视频上应用时的主要失效模式是什么,特别是在几何失真或运动模糊等挑战性属性下?
- RQ4所提出的ASOD60K数据集能否支持沉浸式环境中准确的扫描路径预测和长期眼动建模?
- RQ5分层语义类别和细粒度实例级标注在提升全景视频上SOD模型的性能和可解释性方面有何作用?
主要发现
- 所有模型在ASOD60K上的总体 $S_{\alpha}$ 得分低于0.7,表明全景视频SOD仍是具有挑战性的开放问题。
- 使用音频线索进行训练的模型在跨受试者的眼动预测上表现出显著更高的稳定性,表明音频是强有力的注意力线索。
- 在几何失真(GD)和运动模糊等属性上,性能显著下降,部分模型的 $S_{\alpha}$ 值低于0.6,凸显了当前SOD方法面临的关键挑战。
- 表现最佳的模型在测试集上的平均 $E_{\phi}^{\text{mean}}$ 为0.749,$\mathcal{M}$ 为0.017,但即使该模型在存在遮挡或高失真的复杂场景中仍会失效。
- 研究发现,模型在长距离扫描路径预测方面表现不佳,这从复杂动态内容序列中较低的 $\mathcal{M}$ 值中得到证实。
- 基于属性的分析表明,模型在检测运动模糊和遮挡条件下的显著性物体时尤为薄弱,部分情况下 $S_{\alpha}$ 低于0.5。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。