[论文解读] WEPSAM: Weakly Pre-Learnt Saliency Model
WEPSAM 通过在有限的眼动数据上进行微调之前,利用 ImageNet 进行领域特定的预训练,提出了一种弱预训练的卷积神经网络,用于视觉显著性预测。该方法在 MIT300 数据集上实现了更快的收敛速度和更优的性能,表明弱预训练显著提升了显著性检测的效率与准确性。
Visual saliency detection tries to mimic human vision psychology which concentrates on sparse, important areas in natural image. Saliency prediction research has been traditionally based on low level features such as contrast, edge, etc. Recent thrust in saliency prediction research is to learn high level semantics using ground truth eye fixation datasets. In this paper we present, WEPSAM : Weakly Pre-Learnt Saliency Model as a pioneering effort of using domain specific pre-learing on ImageNet for saliency prediction using a light weight CNN architecture. The paper proposes a two step hierarchical learning, in which the first step is to develop a framework for weakly pre-training on a large scale dataset such as ImageNet which is void of human eye fixation maps. The second step refines the pre-trained model on a limited set of ground truth fixations. Analysis of loss on iSUN and SALICON datasets reveal that pre-trained network converges much faster compared to randomly initialized network. WEPSAM also outperforms some recent state-of-the-art saliency prediction models on the challenging MIT300 dataset.
研究动机与目标
- 为解决显著性预测中真实眼动数据稀缺的问题,提出一种弱预训练的 CNN 框架。
- 探索利用大规模无标注数据集(如 ImageNet)进行预训练的可行性,以在无需人类眼动标注的情况下训练显著性模型。
- 通过将预训练作为正则化手段,提升显著性预测任务的训练效率与泛化能力。
- 证明在 ImageNet 上进行领域特定的预训练,相较于随机初始化,在下游显著性数据集上能实现更快的收敛速度和更优的性能。
提出的方法
- 采用浅层的 5 层 CNN 架构,包含三个阶段的 CONV-ReLU-MAX_POOL,随后是两个全连接层,最终层包含最大池化(maxout)操作。
- 模型首先在 ImageNet 上使用一种自监督目标进行弱预训练,该目标近似人类眼动模式,且无需真实眼动图。
- 预训练完成后,网络在小规模真实眼动数据集(iSUN 和 SALICON)上进行微调,采用 1024 维回归损失,损失函数为逐元素平方误差。
- 预训练步骤将网络权重初始化为编码显著性相关特征,从而在微调阶段减少对大规模反向传播的依赖。
- 输入图像尺寸固定为 128×128 RGB,输出为通过上采样最终 1024D 向量生成的 32×32 显著性图。
- 第一、二、三卷积阶段分别使用 5×5、3×3 和 3×3 的感受野,配合 2×2 最大池化层。
实验结果
研究问题
- RQ1与随机初始化相比,是否在 ImageNet 上进行弱预训练能显著加速显著性预测微调过程中的收敛?
- RQ2在大规模非眼动标注数据集上进行预训练,是否能提升下游显著性预测任务的泛化能力与性能?
- RQ3在基准数据集上,基于 ImageNet 的领域特定预训练在损失衰减和最终性能方面,相较于随机权重初始化,优势有多大?
- RQ4在 MIT300 数据集上,WEPSAM 与最先进显著性模型相比,在定量指标和定性显著性图准确性方面表现如何?
- RQ5当使用来自 ImageNet 的弱监督进行预训练而非完全依赖标注眼动数据时,轻量级 CNN 架构是否仍能实现具有竞争力的性能?
主要发现
- 预训练后的 WEPSAM 模型收敛更快:在 400 个周期后,训练损失和验证损失分别降至 7.2×10⁻³ 和 7.3×10⁻³,而随机初始化网络的损失分别为 7.7×10⁻³ 和 8.8×10⁻³。
- 训练初期,WEPSAM 的训练损失和验证损失分别为 8.2×10⁻³ 和 8.4×10⁻³,相比随机初始化网络的 10.6×10⁻³ 和 9.6×10⁻³,分别降低了 2.4×10⁻³。
- 在 MIT300 数据集上,WEPSAM 在 AUC-Judd、AUC-Borji、CC、SIM、KL 和 NSS 等指标上均优于多个非学习型模型(如 CIW、CAS、RARE-2012)。
- 尽管仅使用单个 128×128 输入分辨率和三个卷积层,WEPSAM 在 AUC-Judd 和 CC 等多个指标上仍超越了结构更复杂的 MR-CNN 模型。
- 定性结果表明,WEPSAM 能突出语义重要的区域(如人脸、关注对象),而对比模型则产生模糊的显著图,更强调边缘和梯度信息。
- 预训练后模型的预测结果已与真实眼动模式高度一致,表明弱预训练能有效捕捉显著性相关特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。