[论文解读] Invariance Analysis of Saliency Models versus Human Gaze During Scene Free Viewing
本文引入了一个大规模的眼动追踪数据库,包含1,900张失真图像,涵盖19种失真类型,用于研究图像失真对人类注视行为及显著性模型性能的影响。研究发现,旋转和剪切等失真会显著降低显著性模型的准确性,而使用保持注视特征的失真进行数据增强可提升深度显著性模型的鲁棒性。
Most of current studies on human gaze and saliency modeling have used high-quality stimuli. In real world, however, captured images undergo various types of distortions during the whole acquisition, transmission, and displaying chain. Some distortion types include motion blur, lighting variations and rotation. Despite few efforts, influences of ubiquitous distortions on visual attention and saliency models have not been systematically investigated. In this paper, we first create a large-scale database including eye movements of 10 observers over 1900 images degraded by 19 types of distortions. Second, by analyzing eye movements and saliency models, we find that: a) observers look at different locations over distorted versus original images, and b) performances of saliency models are drastically hindered over distorted images, with the maximum performance drop belonging to Rotation and Shearing distortions. Finally, we investigate the effectiveness of different distortions when serving as data augmentation transformations. Experimental results verify that some useful data augmentation transformations which preserve human gaze of reference images can improve deep saliency models against distortions, while some invalid transformations which severely change human gaze will degrade the performance.
研究动机与目标
- 系统研究不同图像失真对自由观看自然场景时人类注视行为的影响。
- 评估最先进显著性模型在预测失真图像上的注视点时的性能退化情况。
- 识别出能保持人类注视模式的失真类型,从而作为提升模型鲁棒性的有效数据增强手段。
- 提供一个基准数据集与分析,以推动在真实世界图像退化条件下的显著性建模研究。
- 指导选择在失真条件下仍能与人类视觉注意对齐的数据增强策略。
提出的方法
- 从CAT2000数据集中构建了一个大规模的眼动追踪数据库,包含1,900张图像(100张参考图像 × 19种失真),所有图像均统一缩放为1080×1920以保持一致性。
- 使用MATLAB生成19种失真类型,包括运动模糊、噪声、JPEG压缩、对比度调整、旋转、剪切、裁剪和镜像。
- 对所有失真图像和参考图像,邀请10名观察者参与眼动追踪实验,以收集人类注视数据。
- 使用IO分数、sAUC和NSS等指标,评估4种最先进深度显著性模型(SAM-VGG、SALICON、ML-Net、SAM-ResNet)和经典模型在该数据集上的表现。
- 基于注视偏移分析,将失真类型划分为“有效”(保持注视模式)和“无效”(显著改变注视)两类。
- 使用有效和无效增强数据集对深度模型进行微调,并与仅在干净参考图像上训练的模型进行性能对比。
实验结果
研究问题
- RQ1不同图像失真如何影响自然场景自由观看过程中的人类注视分布?
- RQ2与干净图像相比,显著性模型在预测失真图像上的注视点时,性能退化程度如何?
- RQ3哪些失真类型能保持人类注视模式,从而可作为提升显著性模型鲁棒性的有效数据增强手段?
- RQ4在保持注视特征的失真图像上微调深度显著性模型,是否能提升其在真实世界失真条件下的泛化能力与鲁棒性?
- RQ5在失真刺激下,深度显著性模型与人类注视预测的上限(IO分数)之间的性能差距如何?
主要发现
- 旋转和剪切失真导致显著性模型性能下降最大,IO分数分别降至0.6543和0.6804,而干净图像的IO分数为0.7335。
- 在极端失真下,人类注视发生显著变化:旋转和剪切会改变主导显著性对象,而低对比度图像则使注视集中于图像中心。
- 在有效数据增强(如镜像、对比度调整、JPEG1、噪声1)上训练的显著性模型优于仅在干净图像上训练的模型,IO分数最高提升0.02。
- 无效增强(如旋转、运动模糊(MotionBlur2)、裁剪)会降低模型性能,微调后IO分数低于基线。
- 在极端噪声和低对比度失真下,使用手工设计特征的经典显著性模型比深度模型更具鲁棒性。
- 在有效失真数据上微调深度模型可提升其在未见失真刺激上的泛化能力与性能,证实了保持注视特征增强的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。