Skip to main content
QUICK REVIEW

[论文解读] Align Yourself: Self-supervised Pre-training for Fine-grained Recognition via Saliency Alignment.

Di Wu, Siyuan Li|arXiv (Cornell University)|Jun 30, 2021
Visual Attention and Saliency Detection参考文献 51被引用 5
一句话总结

本文提出跨视角显著性对齐(CVSA),一种自监督对比学习框架,通过显著性区域裁剪与替换生成视图,再对齐跨视图特征以提升前景定位能力,从而增强细粒度识别性能。CVSA通过联合优化判别性纹理与空间定位能力,在四个细粒度基准上达到最先进性能。

ABSTRACT

Self-supervised contrastive learning has demonstrated great potential in learning visual representations. Despite their success on various downstream tasks such as image classification and object detection, self-supervised pre-training for fine-grained scenarios is not fully explored. In this paper, we first point out that current contrastive methods are prone to memorizing background/foreground texture and therefore have a limitation in localizing the foreground object. Analysis suggests that learning to extract discriminative texture information and localization are equally crucial for self-supervised pre-training under fine-grained scenarios. Based on our findings, we introduce Cross-view Saliency Alignment (CVSA), a contrastive learning framework that first crops and swaps saliency regions of images as a novel view generation and then guides the model to localize on the foreground object via a cross-view alignment loss. Extensive experiments on four popular fine-grained classification benchmarks show that CVSA significantly improves the learned representation.

研究动机与目标

  • 为解决当前对比学习方法在细粒度识别中的局限性,即倾向于记忆背景与前景纹理而非实现对象定位。
  • 探究在自监督预训练中学习判别性纹理特征与精确前景定位的双重重要性。
  • 提出一种基于显著性区域的新型视图生成策略,以增强细粒度分类的表征学习能力。
  • 设计一种跨视图对齐损失,明确鼓励模型在增强视图中关注前景对象。

提出的方法

  • 该方法提出一种新颖的视图生成技术,通过从不同图像中裁剪并交换显著性区域,生成对比视图。
  • 利用显著性图识别并提取最具判别性的对象区域,确保模型学习聚焦于前景。
  • 设计一种跨视图对齐损失,对齐同一实例在交换视图中的特征,促进鲁棒的定位能力。
  • 将该损失整合进对比学习目标中,联合优化实例判别与空间注意力。
  • 模型在图像级对比信号下进行自监督预训练,无需边界框或类别标签。
  • 最终表征在下游细粒度分类任务中通过标准线性探针或端到端微调进行微调。

实验结果

研究问题

  • RQ1当前对比学习方法为何在细粒度识别中因纹理记忆而失败?
  • RQ2基于显著性的视图增强在自监督预训练中能在多大程度上改善定位与表征质量?
  • RQ3与标准数据增强相比,显著性区域的跨视图对齐是否能在细粒度基准上带来更好的泛化性能?
  • RQ4纹理判别与空间定位在自监督细粒度表征学习中的相对贡献如何?

主要发现

  • CVSA在四个细粒度图像分类基准上达到最先进性能,优于现有自监督方法。
  • 消融研究证实,基于显著性的视图生成与跨视图对齐对性能提升均不可或缺。
  • 模型在不同视图中更一致地关注前景对象,减少了对虚假纹理的依赖。
  • 该方法在长尾分布与高度相似的细粒度类别上显著优于基线对比学习方法。
  • 性能增益在不同主干网络架构上保持一致,表明该方法具备良好的泛化能力。
  • 结果表明,联合优化纹理判别与定位能力可生成更鲁棒的细粒度场景表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。