Skip to main content
QUICK REVIEW

[论文解读] Do Saliency Models Detect Odd-One-Out Targets? New Datasets and Evaluations

Iuliia Kotseruba, Calden Wloka|arXiv (Cornell University)|May 13, 2020
Visual Attention and Saliency Detection被引用 11
一句话总结

本文引入了两个新数据集——P3(心理物理学模式)和O3(自然奇异数一刺激)——以评估显著性模型在单个目标检测这一视觉注意核心任务中的表现。尽管经过广泛测试,几乎所有经典和基于深度学习的显著性模型在可靠检测奇异数一目标方面表现不佳,且通过P3或O3数据增强训练集仅带来微小的性能提升,暴露出当前模型在模拟人类注意机制方面存在关键缺陷。

ABSTRACT

Recent advances in the field of saliency have concentrated on fixation prediction, with benchmarks reaching saturation. However, there is an extensive body of works in psychology and neuroscience that describe aspects of human visual attention that might not be adequately captured by current approaches. Here, we investigate singleton detection, which can be thought of as a canonical example of salience. We introduce two novel datasets, one with psychophysical patterns and one with natural odd-one-out stimuli. Using these datasets we demonstrate through extensive experimentation that nearly all saliency algorithms do not adequately respond to singleton targets in synthetic and natural images. Furthermore, we investigate the effect of training state-of-the-art CNN-based saliency models on these types of stimuli and conclude that the additional training data does not lead to a significant improvement of their ability to find odd-one-out targets. Datasets are available at http://data.nvision2.eecs.yorku.ca/P3O3/.

研究动机与目标

  • 为解决显著性模型在奇异数一检测任务中缺乏系统性评估的问题,该任务是视觉注意领域的典型任务。
  • 探究当前显著性模型在合成与自然图像设置下是否能有效检测单个目标。
  • 评估在新型奇异数一数据集(P3和O3)上训练深度学习显著性模型对其性能的影响。
  • 识别人类视觉注意与算法性能在视觉搜索任务中持续存在的差距。

提出的方法

  • 提出了两个新数据集:P3,包含经心理物理学验证的具有颜色/方向单个异常刺激的合成图像;O3,由包含奇异数一目标的自然图像组成。
  • 在P3和O3刺激上收集了人类注视数据,以建立模型评估的基准真值。
  • 使用AUC-Judd、CC、KLDiv、NSS、SIM以及目标/背景平均显著性比值等标准指标,在P3、O3和MIT1003数据集上评估了15种经典及深度学习显著性模型。
  • 将两种最先进的基于CNN的模型(MLNet和SALICON)在原始训练数据与P3和O3数据合并后的数据上进行训练,以评估其可迁移性及性能增益。
  • 在缺乏完整注视图的情况下,使用目标二值掩码作为人类注视的代理。
  • 进行了消融研究,以分离P3与O3数据对模型泛化能力及奇异数一检测能力的影响。

实验结果

研究问题

  • RQ1经典和基于深度学习的显著性模型能否在合成与自然图像刺激中可靠检测奇异数一目标?
  • RQ2通过P3和O3数据集增强显著性模型的训练数据,是否能显著提升其检测单个目标的能力?
  • RQ3显著性模型在P3和O3上的性能指标(AUC、CC、NSS)与人类注视模式相比如何?
  • RQ4基于CNN的模型在P3和O3数据上学习后,能否有效泛化到MIT1003等标准基准测试集?
  • RQ5在单个目标检测任务中,人类视觉注意与算法显著性之间存在哪些定性和定量差异?

主要发现

  • 经典显著性模型在P3刺激上的表现优于深度学习模型,表明当前基于CNN的方法在基于特征的单个目标检测方面未被充分优化。
  • 在O3数据上训练MLNet和SALICON模型后,其在O3测试图像上的表现最佳,且MSR_target > MSR_background,表明目标区分能力得到提升。
  • 通过P3或O3数据增强训练数据,在MIT1003上的注视预测准确率仅略有提升,所有模型的AUC-Judd值增加均不足0.02。
  • 当将原始训练数据与O3数据结合时,MIT1003上的整体性能最佳,MLNet的AUC-Judd达到0.82,OSIE达到0.86。
  • 在O3数据上训练的SALICON和OSIE模型,其目标显著性比值(MSR_target > 0.9)高于在P3数据上训练的模型(MSR_target ≈ 0.44–0.46),表明后者目标区分能力差。
  • 尽管经过大量训练,仅在P3数据上训练的模型整体表现最差,AUC-Judd为0.51,NSS为0.13,表明其与人类注视模式严重脱节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。