[论文解读] DeepFeat: A Bottom Up and Top Down Saliency Model Based on Deep Features of Convolutional Neural Nets
本文提出 DeepFeat,一种基于预训练卷积神经网络(CNN)特征整合自下而上和自上而下视觉线索的显著性模型,用于预测人类眼动注视点。通过结合早期 CNN 层的低层次边缘和纹理特征与深层 CNN 层的高层次语义表征,DeepFeat 在 MIT1003 数据集上的四项评估指标中达到最先进性能,总体排名第二,优于单独的自下而上和自上而下方法。
A deep feature based saliency model (DeepFeat) is developed to leverage the understanding of the prediction of human fixations. Traditional saliency models often predict the human visual attention relying on few level image cues. Although such models predict fixations on a variety of image complexities, their approaches are limited to the incorporated features. In this study, we aim to provide an intuitive interpretation of convolu- tional neural network deep features by combining low and high level visual factors. We exploit four evaluation metrics to evaluate the correspondence between the proposed framework and the ground-truth fixations. The key findings of the results demon- strate that the DeepFeat algorithm, incorporation of bottom up and top down saliency maps, outperforms the individual bottom up and top down approach. Moreover, in comparison to nine 9 state-of-the-art saliency models, our proposed DeepFeat model achieves satisfactory performance based on all four evaluation metrics.
研究动机与目标
- 解决传统显著性模型依赖手工设计的低层次特征且无法捕捉任务驱动注意力的局限性。
- 提供一种可解释的框架,利用卷积神经网络(CNN)中预训练深度特征的低层次和高层次视觉线索。
- 通过利用深度特征整合自下而上(刺激驱动)和自上而下(目标导向)注意力机制,提升显著性预测性能。
- 在 MIT1003 基准数据集上,使用多种标准指标评估所提模型与最先进显著性模型的性能。
- 证明结合来自多个 CNN 层的深度特征可提升显著性预测的准确性和鲁棒性。
提出的方法
- 该模型从预训练 CNN 的多个层次提取深度特征,利用卷积层、批归一化层和池化层的激活图作为视觉线索。
- 自下而上的显著性由早期 CNN 层计算,捕捉边缘、颜色和明暗对比等低层次特征。
- 自上而下的显著性由深层 CNN 层推导,编码物体类别和场景上下文等高层次语义信息。
- 最终显著性图通过学习或固定加权策略融合自下而上和自上而下的显著性图生成。
- 将中心偏差整合到预测中,以与人类眼动模式对齐,提升与真实眼动点的相关性。
- 使用四个指标(AUC、AUC Borji、CC 和 KL 散度)在 MIT1003 数据集上评估模型性能。
实验结果
研究问题
- RQ1来自预训练 CNN 的深度特征能否有效表征自下而上和自上而下的视觉注意力成分?
- RQ2与单独方法相比,利用深度特征融合自下而上和自上而下的显著性图是否能提升眼动预测的准确性?
- RQ3DeepFeat 模型在多个评估指标上与九种最先进显著性模型相比表现如何?
- RQ4引入中心偏差在多大程度上提升了 DeepFeat 模型的性能?
- RQ5整合多层级深度特征能否带来更具可解释性和鲁棒性的显著性预测?
主要发现
- 集成中心偏差的 DeepFeat 模型在其自身变体中表现最佳,优于未集成中心偏差的实现。
- 在 MIT1003 数据集上,DeepFeat 在 AUC 和 AUC Borji 指标中排名第二,仅次于 eDN 模型。
- 该模型在 CC 指标上得分为 0.728,在 10 个模型中排名第二,表明与人类眼动图具有强相关性。
- 在 KL 散度评估中,DeepFeat 排名第四,GBVS、ML-Net 和 UHF 表现更优,表明其预测区域略广。
- 该模型每张图像的推理时间约为 150 秒(CPU 上运行),表明其在高质量显著性预测方面具有适中的计算成本。
- 结果证实,结合来自低层次和高层次 CNN 层的深度特征,可显著提升显著性预测性能,优于传统模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。