[论文解读] Semantic and Contrast-Aware Saliency
该论文提出SCAFI,一种通过两条并行路径整合语义感知与对比度感知线索的启发式显著性模型:一条路径利用VGG-16特征实现自上而下的语义注意,另一条路径则通过多尺度在线特征学习实现自下而上的对比度检测。该模型在五个基准数据集上达到最先进性能,其眼动预测效果和心理物理学合理性均优于经典方法与基于深度学习的方法。
In this paper, we proposed an integrated model of semantic-aware and contrast-aware saliency combining both bottom-up and top-down cues for effective saliency estimation and eye fixation prediction. The proposed model processes visual information using two pathways. The first pathway aims to capture the attractive semantic information in images, especially for the presence of meaningful objects and object parts such as human faces. The second pathway is based on multi-scale on-line feature learning and information maximization, which learns an adaptive sparse representation for the input and discovers the high contrast salient patterns within the image context. The two pathways characterize both long-term and short-term attention cues and are integrated dynamically using maxima normalization. We investigate two different implementations of the semantic pathway including an End-to-End deep neural network solution and a dynamic feature integration solution, resulting in the SCA and SCAFI model respectively. Experimental results on artificial images and 5 popular benchmark datasets demonstrate the superior performance and better plausibility of the proposed model over both classic approaches and recent deep models.
研究动机与目标
- 开发一种显著性模型,有效整合语义(自上而下)与对比度(自下而上)线索,以实现更准确的眼动预测。
- 克服先前深度模型过度拟合语义对象、无法捕捉局部对比度模式的局限性。
- 设计一种无需学习的启发式框架,避免依赖大规模眼动追踪数据来训练语义路径。
- 确保模型对人工与自然显著模式产生生物上合理的响应,而不仅限于对象级注意。
提出的方法
- 该模型采用双路径架构:一条路径从预训练的VGG-16网络的conv5层提取语义特征,实现自上而下的显著性。
- 第二条路径采用基于信息最大化原理的多尺度在线特征学习,以发现自适应稀疏表示并检测高对比度显著模式。
- 通过最大值归一化动态整合语义与对比度特征,以平衡长期与短期注意线索。
- SCAFI变体直接从VGG-16提取特征,无需微调,从而消除了对语义路径训练额外标注数据的依赖。
- 模型采用加权融合策略(SAS权重)结合语义与对比度图,最优性能在使用conv5响应(w₅)时达到。
- 框架通过五个基准数据集的sAUC分数进行评估,并在人工显著性模式上进行测试,以评估其生物合理性。
实验结果
研究问题
- RQ1统一的显著性模型能否有效结合自上而下的语义意识与自下而上的对比度敏感性,以提升眼动预测性能?
- RQ2一种无需学习的启发式方法,将VGG特征与自适应稀疏编码相结合,是否在显著性估计中优于端到端深度学习模型?
- RQ3与最先进模型相比,该模型对前注意视觉模式与高对比度刺激的响应能力如何?
- RQ4在多样化数据集上,语义与对比度特征的最佳融合策略是什么,以实现性能最大化?
主要发现
- 在PASCAL-Part数据集上,SCAFI在平均sAUC得分上达到0.7238,优于DPN与DeepGazeII。
- 在Bruce数据集上,SCAFI使用w₅时sAUC达到0.7378,为所有测试模型中的最高分,包括SCA与DPN。
- SCAFI在人工刺激(如闭合性、纹理对比)中成功定位显著模式,其心理物理学合理性优于DPN与DeepGazeII等模型。
- 使用w₁与w₂权重的模型对显著模式产生最符合视觉直觉的响应,尽管它们在眼动预测中并非最优。
- SCAFI在全部五个基准数据集上均优于先前的SCA模型,证实直接提取VGG特征优于微调的语义路径。
- 通过w₅将自适应稀疏编码(CAS)与conv5特征(SAS)融合,实现最佳整体性能,所有数据集的sAUC得分均稳定高于0.70。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。