Skip to main content
QUICK REVIEW

[论文解读] Layer Grafted Pre-training: Bridging Contrastive Learning And Masked Image Modeling For Label-Efficient Representations

Ziyu Jiang, Yinpeng Chen|arXiv (Cornell University)|Feb 27, 2023
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出了一种名为分层嫁接预训练(Layer Grafted Pre-training)的新方法,通过依次在低层应用掩码图像建模(MIM)和在高层应用对比学习(CL),避免梯度冲突。通过将MIM训练的低层进行嫁接,并使用CL微调高层,该方法实现了最先进的标签效率,在仅使用1%标注数据的情况下,ImageNet-1k数据集上达到65.5%的Top-1准确率——比MIM高出14.4%,比CL基线高出2.1%。

ABSTRACT

Recently, both Contrastive Learning (CL) and Mask Image Modeling (MIM) demonstrate that self-supervision is powerful to learn good representations. However, naively combining them is far from success. In this paper, we start by making the empirical observation that a naive joint optimization of CL and MIM losses leads to conflicting gradient directions - more severe as the layers go deeper. This motivates us to shift the paradigm from combining loss at the end, to choosing the proper learning method per network layer. Inspired by experimental observations, we find that MIM and CL are suitable to lower and higher layers, respectively. We hence propose to combine them in a surprisingly simple, "sequential cascade" fashion: early layers are first trained under one MIM loss, on top of which latter layers continue to be trained under another CL loss. The proposed Layer Grafted Pre-training learns good visual representations that demonstrate superior label efficiency in downstream applications, in particular yielding strong few-shot performance besides linear evaluation. For instance, on ImageNet-1k, Layer Grafted Pre-training yields 65.5% Top-1 accuracy in terms of 1% few-shot learning with ViT-B/16, which improves MIM and CL baselines by 14.4% and 2.1% with no bells and whistles. The code is available at https://github.com/VITA-Group/layerGraftedPretraining_ICLR23.git.

研究动机与目标

  • 为解决在自监督表示学习中,掩码图像建模(MIM)与对比学习(CL)联合优化时存在的固有梯度冲突问题。
  • 探究MIM与CL在特征学习中是否表现出分层偏好,特别是对局部细节与语义不变性的影响。
  • 通过以顺序、非冲突的方式战略性地结合MIM与CL,提升下游任务中的标签效率,尤其是在少样本和线性评估场景下。
  • 证明一种简单、级联式的训练策略——先MIM后CL——优于联合优化及现有预训练范式,且无需额外组件。

提出的方法

  • 该方法使用MIM损失训练低层,以通过掩码重建捕捉局部空间结构和细粒度细节。
  • 在完成MIM预训练后,对低层进行部分微调,同时在高层使用CL损失进行训练,以学习语义不变性和聚类结构。
  • 通过在CL训练期间逐步微调低层,使嫁接过程更加平滑,减少对已学习表征的破坏。
  • 通过将MIM与CL损失分离至网络不同深度层级,避免联合优化带来的梯度冲突。
  • 该方法采用顺序级联方式:先对浅层应用MIM,再对深层应用CL,且实验表明该顺序至关重要。
  • 通过ImageNet-1k等标准基准进行评估,采用线性评估和少样本微调协议以衡量标签效率。

实验结果

研究问题

  • RQ1当MIM与CL在深层网络层中联合优化时,是否会产生冲突的梯度方向?
  • RQ2视觉Transformer的低层与高层是否更偏好不同的自监督目标——具体而言,MIM是否更适用于低层,而CL更适用于高层?
  • RQ3能否通过顺序性、分层地应用MIM后接CL,优于联合优化和标准预训练基线,在标签效率学习中取得更好性能?
  • RQ4应用MIM与CL的顺序是否对最终表征质量和下游性能有显著影响?
  • RQ5一种简单、模块化的预训练策略,结合MIM与CL,是否能在无需额外组件或复杂设计的情况下,实现最先进的少样本性能?

主要发现

  • 所提出的分层嫁接预训练方法在ImageNet-1k数据集上,使用1%少样本学习时,达到65.5%的Top-1准确率,分别比MIM和CL基线高出14.4%和2.1%。
  • 在线性评估中,该方法达到74.9%的Top-1准确率,较MIM提升9.7%,较CL基线提升1.0%。
  • 性能提升在低数据场景下最为显著,证实了该方法在标签效率方面的优越性。
  • 消融实验表明,若调换嫁接顺序(即先CL后MIM),性能将显著下降,证明了分层损失分配的重要性。
  • 该方法表明,由于深层网络中存在严重的梯度冲突,MIM与CL无法通过联合优化直接结合。
  • 该方法的成功归因于对MIM(用于早期层的局部结构学习)与CL(用于深层的语义不变性学习)的策略性分离,避免了冲突的优化信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。