Skip to main content
QUICK REVIEW

[论文解读] Can Semantic Labels Assist Self-Supervised Visual Representation Learning?

Longhui Wei, Lingxi Xie|arXiv (Cornell University)|Nov 17, 2020
Domain Adaptation and Few-Shot Learning被引用 9
一句话总结

该论文提出了一种名为SCAN(Supervised Contrastive Adjustment in Neighborhood)的新型自监督学习方法,通过在对比学习中引入语义标签来提升视觉表征的迁移性能。通过在对比训练过程中将语义和外观相似的邻居作为正样本,SCAN在下游检测与分割任务中取得了最先进(SOTA)的性能表现,优于完全监督和自监督基线方法,包括在COCO目标检测任务中实现了1.7%的AP提升。

ABSTRACT

Recently, contrastive learning has largely advanced the progress of unsupervised visual representation learning. Pre-trained on ImageNet, some self-supervised algorithms reported higher transfer learning performance compared to fully-supervised methods, seeming to deliver the message that human labels hardly contribute to learning transferrable visual features. In this paper, we defend the usefulness of semantic labels but point out that fully-supervised and self-supervised methods are pursuing different kinds of features. To alleviate this issue, we present a new algorithm named Supervised Contrastive Adjustment in Neighborhood (SCAN) that maximally prevents the semantic guidance from damaging the appearance feature embedding. In a series of downstream tasks, SCAN achieves superior performance compared to previous fully-supervised and self-supervised methods, and sometimes the gain is significant. More importantly, our study reveals that semantic labels are useful in assisting self-supervised methods, opening a new direction for the community.

研究动机与目标

  • 探究尽管对比学习已取得成功,语义标签是否能对自监督视觉表征学习产生有意义的帮助。
  • 解决来自监督学习的任务特定语义特征与来自自监督学习的任务无关外观特征之间的冲突。
  • 设计一种方法,使语义引导与对比学习协同结合,同时不损害泛化能力或性能。
  • 证明合理利用语义标签可显著提升下游任务中的迁移性能。

提出的方法

  • SCAN通过将正样本定义为在语义和外观上均与查询样本最相似的样本,而非所有同类别图像,来修改对比学习目标。
  • 它继承自无监督对比学习(如MoCo-v2)的预训练模型,并重新定义每个查询图像的邻域,使其包含语义和视觉上相似的实例。
  • 该方法保留一组正样本邻居(例如,在嵌入空间和标签空间中相似度最高的K个),而将其余所有样本视为负样本。
  • 对比损失被调整为拉近查询样本与其正样本邻居的距离,同时推远所有其他负样本,从而在不损害外观泛化能力的前提下增强语义区分能力。
  • 该实现仅需对现有对比学习框架进行极少的代码修改,因此易于采用。
  • 该方法通过在ImageNet-1K上的线性评估以及在COCO、VOC和Cityscapes上的微调,评估了在目标检测与实例分割任务中的性能。

实验结果

研究问题

  • RQ1当语义标签被合理整合时,是否能提升自监督视觉表征学习?
  • RQ2将语义监督与对比学习结合,是否能带来优于纯自监督或完全监督方法的迁移性能?
  • RQ3语义特征与外观特征的融合如何影响下游任务(如目标检测与实例分割)的性能?
  • RQ4正样本邻居数量的变化对模型泛化能力和性能有何影响?

主要发现

  • 在VOC目标检测任务中,SCAN达到83.3%的AP50,在VOC语义分割任务中达到76.6%的mIoU,优于完全监督和自监督基线方法。
  • 在COCO数据集上,SCAN将APbb从MoCo-v2的39.2%提升至40.9%,在目标检测任务中实现显著增益。
  • 在实例分割任务中,SCAN在COCO上达到37.2%的APmk,较MoCo-v2提升1.5%。
  • 在Cityscapes数据集上,SCAN在语义分割任务中达到76.5%的mIoU,超过MoCo-v2的75.2%。
  • 在ImageNet-1K上的线性评估显示,SCAN达到75.0%的Top-1准确率,较MoCo-v2提升3.9%。
  • 分析表明,SCAN显著提升了对小物体和中等物体的检测性能(APbbS: 24.3 vs. 23.8,APbbM: 46.7 vs. 45.6),证实了其语义区分能力的增强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。