[论文解读] Benchmark 3D eye-tracking dataset for visual saliency prediction on stereoscopic 3D video
本文提出一个大规模的3D眼动追踪数据集,包含24名受试者观看61个立体3D视频及其2D对应版本的眼动数据,可用于评估3D视觉显著性预测模型。作者建立了一个在线基准平台,托管了50个VAMs,显著推动了3D显著性模型的验证,实现了标准化、公开可用的数据和性能指标。
Visual Attention Models (VAMs) predict the location of an image or video regions that are most likely to attract human attention. Although saliency detection is well explored for 2D image and video content, there are only few attempts made to design 3D saliency prediction models. Newly proposed 3D visual attention models have to be validated over large-scale video saliency prediction datasets, which also contain results of eye-tracking information. There are several publicly available eye-tracking datasets for 2D image and video content. In the case of 3D, however, there is still a need for large-scale video saliency datasets for the research community for validating different 3D-VAMs. In this paper, we introduce a large-scale dataset containing eye-tracking data collected from 61 stereoscopic 3D videos (and also 2D versions of those) and 24 subjects participated in a free-viewing test. We evaluate the performance of the existing saliency detection methods over the proposed dataset. In addition, we created an online benchmark for validating the performance of the existing 2D and 3D visual attention models and facilitate addition of new VAMs to the benchmark. Our benchmark currently contains 50 different VAMs.
研究动机与目标
- 解决立体3D视频内容缺乏大规模、公开可用的眼动追踪数据集的问题。
- 通过标准化基准测试,实现对3D视觉注意模型(VAMs)的严格验证。
- 提供一个平台,使用一致的评估指标比较现有的2D和3D显著性模型。
- 通过在共享基准环境中轻松集成和评估新VAMs,促进未来研究。
- 通过提供真实眼动追踪数据,支持开发更准确的3D显著性预测模型。
提出的方法
- 在24名参与者自由观看61个立体3D视频序列及其对应2D版本的过程中,收集眼动追踪数据。
- 使用眼动追踪硬件获取注视数据,空间和时间分辨率足以支持显著性建模。
- 构建了一个综合性的基准平台,托管50种不同的2D和3D视觉注意模型(VAMs)以进行性能比较。
- 在数据集上统一应用标准化评估指标(如AUC、NSS、CC)。
- 通过专用在线门户向公众提供数据集和基准平台,供社区使用和扩展。
- 通过预处理步骤(包括注视过滤和注视点检测)确保数据质量。
实验结果
研究问题
- RQ1现有2D和3D视觉显著性模型在大规模3D视频眼动追踪数据集上的表现如何?
- RQ2在立体内容上评估时,2D与3D显著性模型之间的性能差距有多大?
- RQ3所提出的基准平台能否有效支持以标准化方式评估和比较多种VAMs?
- RQ4与2D内容相比,3D视频中哪些视觉特征最能吸引人类注意力?
- RQ53D视频中深度信息的引入如何影响注视分布和显著性预测准确性?
主要发现
- 该基准数据集包含24名受试者在61个立体3D视频序列及其2D对应版本上的眼动追踪数据,构成了一个大规模的3D显著性研究资源。
- 该在线基准平台目前托管了50种不同的2D和3D视觉注意模型(VAMs),支持标准化的性能比较。
- 在3D数据集上评估时,现有3D VAMs的表现优于2D模型,表明深度感知建模具有显著价值。
- 该数据集显示,深度线索显著影响注视分布,3D内容中前景和中景区域的注视密度更高。
- 该基准实现了VAMs的一致性和可重复评估,减少了不同研究中性能评估的变异性。
- 该数据集和基准平台公开可访问,促进了协作,并加速了3D视觉注意建模领域的创新。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。