[论文解读] Towards Fine-grained Visual Representations by Combining Contrastive Learning with Image Reconstruction and Attention-weighted Pooling
本文提出 ConRec,一种自监督学习框架,通过联合优化对比学习与图像重建及注意力加权池化,增强细粒度视觉表征。通过结合基于 U-Net 的编码器-解码器与对比投影头,ConRec 在细粒度分类基准上优于 SimCLR 及使用注意力池化的 SimCLR,展现出更精细的特征表示与对局部扰动更强的鲁棒性。
This paper presents Contrastive Reconstruction, ConRec - a self-supervised learning algorithm that obtains image representations by jointly optimizing a contrastive and a self-reconstruction loss. We showcase that state-of-the-art contrastive learning methods (e.g. SimCLR) have shortcomings to capture fine-grained visual features in their representations. ConRec extends the SimCLR framework by adding (1) a self-reconstruction task and (2) an attention mechanism within the contrastive learning task. This is accomplished by applying a simple encoder-decoder architecture with two heads. We show that both extensions contribute towards an improved vector representation for images with fine-grained visual features. Combining those concepts, ConRec outperforms SimCLR and SimCLR with Attention-Pooling on fine-grained classification datasets.
研究动机与目标
- 为解决 SimCLR 等对比学习方法在捕捉细粒度视觉特征时因局部细节敏感度不足而存在的局限性。
- 通过将图像重建与注意力机制整合进对比学习框架,提升细粒度分类的表征质量。
- 证明联合优化重建与对比学习可生成更具判别性、高粒度的特征,适用于复杂视觉类别。
- 在细粒度数据集(包括医学影像与细粒度视觉分类任务)上验证所提架构的有效性。
提出的方法
- ConRec 使用双头 U-Net 编码器-解码器架构,通过跳跃连接处理掩码输入图像,同时生成重建图像与对比表示。
- 模型并行优化两种损失:基于动量对比学习(MoCo 风格)的对比损失与像素级均方误差重建损失。
- 在投影前对编码器特征应用注意力加权池化,使模型在表征学习过程中聚焦显著的局部区域。
- 对于每个 N 个无标签图像,生成两个增强后的掩码视图,模型在 2N 个视图上同时执行重建与对比学习。
- 最终表征向量由应用于注意力池化特征的投影头生成,支持下游对比优化。
- 整体损失为加权和:$\mathcal{L}_{\text{ConRec}} = \mathcal{L}_c + \alpha \cdot \mathcal{L}_r$,其中 $\alpha$ 平衡两项目标。
实验结果
研究问题
- RQ1将自重建与注意力池化整合是否能提升对比表征在细粒度分类中的判别能力?
- RQ2与标准 SimCLR 相比,联合优化对比与重建目标是否能带来更好的细粒度视觉识别泛化性能?
- RQ3注意力加权池化在自监督表征学习中在多大程度上增强了特征定位能力与对局部图像扰动的鲁棒性?
- RQ4ConRec 在具有高类内差异与细微类间差异的数据集(如牛津花卉与糖尿病视网膜病变图像)上的表现如何?
主要发现
- ConRec 在牛津花卉-102 细粒度分类数据集上优于标准 SimCLR,通过联合优化对比与重建损失实现更高的准确率。
- 在 SimCLR 中加入注意力加权池化显著提升细粒度分类性能,表明其能更好地聚焦于判别性局部特征。
- 当同时使用重建与注意力机制时,ConRec 在糖尿病视网膜病变分类任务中实现进一步性能提升,证实二者具有互补作用。
- 消融实验表明,重建与注意力机制均独立提升表征质量,二者结合效果最佳。
- 性能提升归因于对局部细粒度视觉属性的增强敏感性,同时对遮挡与光照变化等全局扰动保持鲁棒。
- 结果证实,自重建有助于模型学习更详细、语义有意义的特征,尤其在细粒度识别中至关重要的低级视觉模式方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。