[论文解读] What Do Deep Saliency Models Learn about Visual Attention?
本文提出了一种新颖的分析框架,通过将深度显著性模型的隐式特征分解为可解释的语义基,并通过概率图的加权组合量化其对显著性预测的贡献,从而解释深度显著性模型。该方法揭示了模型如何为语义分配正负权重,识别失败模式,并实现对自闭症、情绪及时间动态下人类注意力的分析,同时在仅进行最小架构修改的情况下保持了最先进性能。
In recent years, deep saliency models have made significant progress in predicting human visual attention. However, the mechanisms behind their success remain largely unexplained due to the opaque nature of deep neural networks. In this paper, we present a novel analytic framework that sheds light on the implicit features learned by saliency models and provides principled interpretation and quantification of their contributions to saliency prediction. Our approach decomposes these implicit features into interpretable bases that are explicitly aligned with semantic attributes and reformulates saliency prediction as a weighted combination of probability maps connecting the bases and saliency. By applying our framework, we conduct extensive analyses from various perspectives, including the positive and negative weights of semantics, the impact of training data and architectural designs, the progressive influences of fine-tuning, and common failure patterns of state-of-the-art deep saliency models. Additionally, we demonstrate the effectiveness of our framework by exploring visual attention characteristics in various application scenarios, such as the atypical attention of people with autism spectrum disorder, attention to emotion-eliciting stimuli, and attention evolution over time. Our code is publicly available at \url{https://github.com/szzexpoi/saliency_analysis}.
研究动机与目标
- 理解深度显著性模型所学习的隐式特征及其在预测人类视觉注意力中的作用。
- 开发一种系统化且可解释的框架,量化语义属性对显著性预测的贡献。
- 研究训练数据、模型架构和微调对显著性模型中语义加权的影响。
- 分析自闭症谱系障碍、情绪刺激和注意力随时间演变等特殊情境下的人类注意力特征。
- 识别当前最先进显著性模型中的常见失败模式,并提出实现整体特征融合的改进建议。
提出的方法
- 该框架将深度显著性模型的内部特征分解为可训练的、可解释的语义基,这些语义基与Visual Genome数据集中细粒度属性对齐。
- 它将显著性预测重新表述为概率图的加权组合,其中每个图表示特定语义基的存在。
- 通过测量学习到的语义基与语义属性之间的对齐程度,量化语义相关性,从而实现对正负权重的解释。
- 该方法仅对最后两层进行最小的架构修改,确保在多个基准测试中与原始模型保持性能一致。
- 采用概率方法量化每个语义基对显著性的影响,从而实现对模型行为的系统性分析。
- 该框架被应用于分析SALICON、DINet和TranSalNet等模型的推理过程、微调动态及失败案例。

实验结果
研究问题
- RQ1深度显著性模型如何通过正负权重区分显著与非显著语义?
- RQ2训练数据和模型架构如何影响显著性预测中学习到的语义权重?
- RQ3微调如何影响显著性模型中语义属性的权重分配?
- RQ4深度显著性模型能否捕捉细微的人类注意力模式,例如自闭症谱系障碍或情绪刺激下的注意力?
- RQ5当前最先进显著性模型中的常见失败模式是什么?要弥合与人类注意力的差距,还缺少什么?
主要发现
- 该框架保持了具有竞争力的性能,在OSIE数据集上达到NSS 2.91和CC 0.64,与SALICON和SAM等最先进模型相当或更优。
- 深度显著性模型的成功主要依赖于对特征的准确检测能力,以及为语义属性分配正负权重的能力。
- 训练数据和模型架构显著影响语义权重的分布与大小,微调通过更优地分配非显著语义的权重来提升性能。
- 该方法成功识别出SALICON、DINet和TranSalNet等模型中的常见失败模式,尤其在处理复杂或非典型注意力场景时表现突出。
- 该框架能够对特殊情境下的人类注意力进行有意义的分析,包括自闭症中的非典型注意力、情绪诱发刺激下的注意力,以及注意力随时间的动态演变。
- 本研究揭示,在具有挑战性的显著性预测场景中,整合中低层次线索与结构化高层次语义是提升性能的关键。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。