Skip to main content
QUICK REVIEW

[論文レビュー] Layer Grafted Pre-training: Bridging Contrastive Learning And Masked Image Modeling For Label-Efficient Representations

Ziyu Jiang, Yinpeng Chen|arXiv (Cornell University)|Feb 27, 2023
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文では、勾配の衝突を回避するため、下位層にマスク画像モデリング(MIM)を逐次的に適用し、上位層に対照的学習(CL)を適用する、新しい手法であるレイヤー・グラフトド・プレトレーニングを提案する。MIMで事前学習された下位層をグラフトし、CLで上位層を微調整することで、最先端のラベル効率を達成し、1%のラベル付きデータでのImageNet-1kにおけるトップ1精度が65.5%に達する。これはMIMベースラインより14.4%高く、CLベースラインより2.1%高い。

ABSTRACT

Recently, both Contrastive Learning (CL) and Mask Image Modeling (MIM) demonstrate that self-supervision is powerful to learn good representations. However, naively combining them is far from success. In this paper, we start by making the empirical observation that a naive joint optimization of CL and MIM losses leads to conflicting gradient directions - more severe as the layers go deeper. This motivates us to shift the paradigm from combining loss at the end, to choosing the proper learning method per network layer. Inspired by experimental observations, we find that MIM and CL are suitable to lower and higher layers, respectively. We hence propose to combine them in a surprisingly simple, "sequential cascade" fashion: early layers are first trained under one MIM loss, on top of which latter layers continue to be trained under another CL loss. The proposed Layer Grafted Pre-training learns good visual representations that demonstrate superior label efficiency in downstream applications, in particular yielding strong few-shot performance besides linear evaluation. For instance, on ImageNet-1k, Layer Grafted Pre-training yields 65.5% Top-1 accuracy in terms of 1% few-shot learning with ViT-B/16, which improves MIM and CL baselines by 14.4% and 2.1% with no bells and whistles. The code is available at https://github.com/VITA-Group/layerGraftedPretraining_ICLR23.git.

研究の動機と目的

  • 自己教師付き表現学習において、マスク画像モデリング(MIM)と対照的学習(CL)を同時に最適化する際に生じる本質的な勾配の衝突を解決すること。
  • MIMとCLが、局所的詳細と意味的不変性の両方の特徴学習において、層ごとに異なる好みを示すかどうかを調査すること。
  • MIMとCLを段階的かつ非衝突的に組み合わせることで、特に少データ学習および線形評価において、ラベル効率を向上させること。
  • MIMを最初に、次にCLを適用するシンプルな段階的トレーニング戦略が、共同最適化や既存の事前学習パラダイムを上回ることを示すこと。

提案手法

  • 下位層をMIM損失で訓練することで、マスクされた再構成により局所的な空間的構造と細分化された詳細を捉える。
  • MIM事前学習後、下位層を部分的に微調整し、上位層をCL損失で訓練することで、意味的不変性とクラスタ構造を学習する。
  • CLトレーニング中に下位層の調整を段階的に許容することで、学習済み表現への破壊的影響を軽減し、グラフトを「滑らか」にする。
  • MIMとCL損失をネットワークの異なる深さレベルに分離することで、両者の共同最適化を避けることで勾配の衝突を回避する。
  • MIMを最初に早期層に適用し、その後に深層部でCLを適用するという段階的かつ連鎖的なアプローチを採用する。この順序が重要であることが示された。
  • 標準ベンチマーク(例:ImageNet-1k)を用い、線形評価と少データ微調整プロトコルを用いて、ラベル効率を評価する。

実験結果

リサーチクエスチョン

  • RQ1MIMとCLを同時に最適化した場合、特に深層部において、勾配の方向が衝突するか?
  • RQ2視覚変換器の下位層と上位層は、それぞれ異なる自己教師付き目的を好むのか?具体的には、MIMは下位層に、CLは上位層に有益であるのか?
  • RQ3MIMを先行しCLを後続する段階的かつ層別的な適用が、共同最適化や標準的な事前学習ベースラインを上回るラベル効率学習を達成できるか?
  • RQ4MIMとCLの適用順序が、最終的な表現品質および下流タスクのパフォーマンスに影響を与えるか?
  • RQ5MIMとCLを組み合わせるシンプルでモジュール的な事前学習戦略が、追加のコンponentsや装飾なしに最先端の少データ学習パフォーマンスを達成できるか?

主な発見

  • 提案手法のレイヤー・グラフトド・プレトレーニングは、1%の少データ学習条件下でImageNet-1kで65.5%のトップ1精度を達成し、MIMベースラインより14.4%、CLベースラインより2.1%高い。
  • 線形評価では74.9%のトップ1精度を達成し、MIMベースラインより9.7%、CLベースラインより1.0%高い。
  • 性能向上は特に低データ環境で顕著であり、本手法の優れたラベル効率を裏付けている。
  • アブレーションスタディでは、CLをMIMより先に適用する順序の逆転が顕著な性能低下を引き起こし、層ごとの損失割り当ての重要性を証明した。
  • MIMとCLは、深層部における深刻な勾配の衝突のため、直接的な共同最適化では組み合わせられないことが判明した。
  • 本手法の成功は、初期層ではMIM(局所的構造)を、深層部ではCL(意味的不変性)を戦略的に分離することで、衝突する最適化信号を回避したことに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。