Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Pre-training with Hard Examples Improves Visual Representations

Chunyuan Li, Xiujun Li|arXiv (Cornell University)|Dec 25, 2020
Domain Adaptation and Few-Shot Learning参考文献 57被引用 16
一句话总结

本文提出一种自监督预训练框架,通过生成困难增强样本(利用对抗训练和CutMix)来提升视觉表征能力,从而创建更具挑战性的伪标签预测任务。由此产生的模型Hexa_MoCo和Hexa_DCluster在ImageNet及下游基准测试中达到最先进性能,尤其在低监督设置下表现突出,证明困难样本可提升自监督学习中的泛化能力。

ABSTRACT

Self-supervised pre-training (SSP) employs random image transformations to generate training data for visual representation learning. In this paper, we first present a modeling framework that unifies existing SSP methods as learning to predict pseudo-labels. Then, we propose new data augmentation methods of generating training examples whose pseudo-labels are harder to predict than those generated via random image transformations. Specifically, we use adversarial training and CutMix to create hard examples (HEXA) to be used as augmented views for MoCo-v2 and DeepCluster-v2, leading to two variants HEXA_{MoCo} and HEXA_{DCluster}, respectively. In our experiments, we pre-train models on ImageNet and evaluate them on multiple public benchmarks. Our evaluation shows that the two new algorithm variants outperform their original counterparts, and achieve new state-of-the-art on a wide range of tasks where limited task supervision is available for fine-tuning. These results verify that hard examples are instrumental in improving the generalization of the pre-trained models.

研究动机与目标

  • 通过生成超越随机数据增强的更具挑战性的训练样本,改进自监督视觉表征学习。
  • 通过显式地将增强方法与学习目标对齐,弥补现有方法将数据增强视为与掩蔽任务无关的缺陷。
  • 探究困难样本(其伪标签难以预测)是否能提升预训练模型的泛化能力。
  • 构建统一的自监督预训练框架,将伪标签分类化,实现困难样本的系统性生成。
  • 在多种自监督学习方法(包括对比学习和原型学习)中验证困难样本的有效性。

提出的方法

  • 本文将自监督预训练建模为伪标签分类任务,目标是预测由数据增强生成的伪标签。
  • 通过对抗训练生成困难样本,通过扰动输入图像以挑战模型的预测能力。
  • 应用CutMix生成通过粘贴不同图像块形成的混合裁剪图像,产生语义模糊的样本,使其更难分类。
  • 将该框架集成到两种现有方法中:MoCo-v2(对比学习)和DeepCluster-v2(原型学习),分别得到Hexa_MoCo和Hexa_DCluster。
  • 所提方法使用标准主干网络和投影头,关键创新在于在数据增强流程中引入困难样本。
  • 训练目标保持不变(对比损失或聚类损失),但增强视图质量的提升带来了更优的特征学习。

实验结果

研究问题

  • RQ1通过有针对性的数据增强生成困难样本,能否提升自监督视觉表征的泛化能力?
  • RQ2与标准随机增强相比,使用基于对抗和CutMix的困难样本在自监督预训练中的表现如何?
  • RQ3所提框架是否在不同自监督学习目标(如对比学习和原型学习)下均能一致提升性能?
  • RQ4在低监督微调场景(如仅使用1% ImageNet标签的半监督学习)中,困难样本在多大程度上提升性能?
  • RQ5基于困难样本的预训练是否能在下游任务准确率上超越标准监督预训练?

主要发现

  • Hexa_DCluster在8-crop增强设置下,仅使用1%标注数据时在ImageNet上达到57.3%的Top-1准确率,优于经过800个周期预训练的BYOL。
  • Hexa_DCluster+在8-crop增强设置下,仅使用200个预训练周期即达到57.3%的Top-1准确率,超越所有现有自监督方法在相同设置下的表现。
  • 在VOC目标检测基准上,Hexa_MoCo优于使用标准增强预训练的MoCo-v2,表明在下游检测任务中具有持续优势。
  • 在半监督学习中,Hexa_DCluster使用1%标签时达到54.9%的Top-1准确率,显著优于预训练200周期的SwAV(53.9% Top-1)。
  • 在100% ImageNet标签下微调时,Hexa达到78.6%的Top-1准确率,超过监督基线(76.5%)2.1个百分点。
  • 结果表明,困难样本显著提升了模型泛化能力,尤其在低数据场景下;且所提框架在不同自监督学习范式中均具通用性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。