[论文解读] What Catches the Eye? Visualizing and Understanding Deep Saliency Models
本文提出了一种简单的深度显著性模型,采用类似残差的解码器和一种新颖的指数绝对距离(EAD)损失,用于像素级注视预测,实现了最先进性能。该研究提出了一种可视化方法,揭示高性能模型学习到语义特征——尤其是动物和身体部位——表明人类显著性不仅依赖于低层次线索,还涉及高层次语义知识。
Deep convolutional neural networks have demonstrated high performances for fixation prediction in recent years. How they achieve this, however, is less explored and they remain to be black box models. Here, we attempt to shed light on the internal structure of deep saliency models and study what features they extract for fixation prediction. Specifically, we use a simple yet powerful architecture, consisting of only one CNN and a single resolution input, combined with a new loss function for pixel-wise fixation prediction during free viewing of natural scenes. We show that our simple method is on par or better than state-of-the-art complicated saliency models. Furthermore, we propose a method, related to saliency model evaluation metrics, to visualize deep models for fixation prediction. Our method reveals the inner representations of deep models for fixation prediction and provides evidence that saliency, as experienced by humans, is likely to involve high-level semantic knowledge in addition to low-level perceptual cues. Our results can be useful to measure the gap between current saliency models and the human inter-observer model and to build new models to close this gap.
研究动机与目标
- 理解深度显著性模型为何优于基于手工设计特征的传统模型。
- 探究深度模型在注视预测中是否学习语义知识,或仅依赖于低层次感知线索。
- 开发一种可视化与解释深度显著性模型内部表征的方法。
- 量化深度显著性模型与人类观察者注视模式之间的差距。
- 评估模型性能是否与预测人类注视的激活图比例相关
提出的方法
- 提出一种简单的全卷积编码器-解码器架构,采用类似残差的解码器,仅使用单分辨率输入且无需对抗生成网络(GAN)训练。
- 引入一种新型像素级损失函数——指数绝对距离(EAD),其性能优于标准损失函数如二元交叉熵(BCE)和巴氏距离。
- 开发一种新颖的可视化技术,用于识别网络中哪些激活图可预测人类注视(称为“正向注视检测器”)。
- 使用归一化平均检测频率 $ f_n(c) = f_d(c)/f_t(c) $ 分析正向注视检测器对哪些视觉类别或部件敏感。
- 将该方法应用于多种模型,包括所提出的模型、SalGAN、Deepnet 和 OpenSalicon,在 SALICON 和 Broden 等数据集上进行评估。
- 量化每种模型中正向注视检测器的比例,并将其与 NSS 等性能指标进行相关性分析
实验结果
研究问题
- RQ1深度显著性模型学习了哪些视觉模式,从而实现高注视预测性能?
- RQ2深度显著性模型在多大程度上依赖语义知识(如物体类别、身体部位)而非低层次感知特征?
- RQ3可预测人类注视的激活图比例与整体模型性能之间有何关系?
- RQ4我们能否可视化并解释深度显著性模型的内部表征,以理解其决策过程?
- RQ5基于 ImageNet 预训练特征训练的模型是否比从零开始训练的模型学习到更具语义意义的注视检测器?
主要发现
- 所提出的简单模型结合 EAD 损失在大多数基准测试中达到最先进性能,优于复杂架构如 Deepfix 和 SalGAN。
- 该模型在 NSS 指标上达到 2.21 的最高分,且正向注视检测器比例最高(4.1%)。
- 模型性能(以 NSS 衡量)与可预测人类注视的激活图比例之间存在强烈正相关(r = 0.94)。
- 正向注视检测器主要对语义类别(如动物:狗、猫、牛;人物;身体部位:头、头发、颈部)敏感,表明存在高层次语义编码。
- 在 ImageNet 上预训练的模型(如 SalGAN、Salicon)对常见动物的检测频率更高,而从零开始训练的模型(如 Deepnet)则更常检测到人造物体。
- 分析揭示非预测性神经元存在明显的负向中心偏差,表明部分网络单元编码了与显著性无关的空间先验
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。