Skip to main content
QUICK REVIEW

[論文レビュー] A simple, efficient and scalable contrastive masked autoencoder for learning visual representations

Shlok Mishra, Joshua A. Robinson|arXiv (Cornell University)|Oct 30, 2022
Domain Adaptation and Few-Shot Learning被引用数 12
ひとこと要約

CAN は、対照的学習、マスク付き自己符号化、ノイズ除去拡散の目的を組み合わせた、シンプルで効率的かつスケーラブルな自己教師あり学習手法です。両方の視覚的ビューで 50% のパッチをマスクし、対照的学習、再構成、ノイズ予測の損失を同時に最適化することで、ImageNet および JFT-300M で最先端の性能を達成し、SimCLR や MAE よりも線形プローブおよび微調整評価で優れ、SimCLR よりも 70% の FLOPs を削減しています。

ABSTRACT

We introduce CAN, a simple, efficient and scalable method for self-supervised learning of visual representations. Our framework is a minimal and conceptually clean synthesis of (C) contrastive learning, (A) masked autoencoders, and (N) the noise prediction approach used in diffusion models. The learning mechanisms are complementary to one another: contrastive learning shapes the embedding space across a batch of image samples; masked autoencoders focus on reconstruction of the low-frequency spatial correlations in a single image sample; and noise prediction encourages the reconstruction of the high-frequency components of an image. The combined approach results in a robust, scalable and simple-to-implement algorithm. The training process is symmetric, with 50% of patches in both views being masked at random, yielding a considerable efficiency improvement over prior contrastive learning methods. Extensive empirical studies demonstrate that CAN achieves strong downstream performance under both linear and finetuning evaluations on transfer learning and robustness tasks. CAN outperforms MAE and SimCLR when pre-training on ImageNet, but is especially useful for pre-training on larger uncurated datasets such as JFT-300M: for linear probe on ImageNet, CAN achieves 75.4% compared to 73.4% for SimCLR and 64.1% for MAE. The finetuned performance on ImageNet of our ViT-L model is 86.1%, compared to 85.5% for SimCLR, and 85.4% for MAE. The overall FLOPs load of SimCLR is 70% higher than CAN for ViT-L models.

研究の動機と目的

  • JFT-300M のような大規模でキュレートされていないデータセットに効率的にスケーリングできる自己教師あり視覚的表現学習手法を開発すること。
  • 既存の対照的学習およびマスク付き自己符号化手法の限界を克服し、それらの相補的な強みを統合すること。
  • 転移学習、少サンプル学習、分布シフトベンチマークにおけるロバストネスと下流タスクのパフォーマンスを向上させること。
  • 対称的マスキングと多目的学習により、計算コストを低減しながらも、モデルの正確性を維持または向上させること。

提案手法

  • CAN は、両方のビューで 50% のパッチをマスクする対称的な学習スキームを採用しており、全視覚的対照的学習手法と比較して FLOPs を削減した効率的な学習を可能にしています。
  • モデルは3つの目的を同時に最適化します:正例ペアの一致を図る InfoNCE 損失による対照的学習、マスクされたパッチの再構成を目的としたマスク付き自己符号化、およびマスクされていないパッチに追加されたガウスノイズの予測を目的としたノイズ除去。
  • ノイズ除去損失は、再構成が注目する低周波成分とは対照的に、高周波成分を学習するようモデルを促します。
  • 対照的損失はバッチ全体にわたって適用される一方、再構成とノイズ除去はサンプルごとに適用され、補完的なインダクティブバイアスを実現します。
  • 本手法はバックボーンにビジョントランスフォーマーを用い、3つの成分を統合した単一で包括的な目的関数により、エンドツーエンドで訓練されます。
  • 対照的損失の重みやノイズレベルといったハイパーパrameterは、3つの目的のバランスを取るために調整されており、最適な設定は λ_InfoNCE = 0.03 および σ_max = 0.05 で得られました。

実験結果

リサーチクエスチョン

  • RQ1対照的学習、マスク付き自己符号化、ノイズ除去を統合することで、下流のビジョンタスクにおける性能が向上するか?
  • RQ2両方のビューで 50% のパッチを対称的にマスクすることで、性能を損なわず効率が向上するか?
  • RQ3対照的学習(サンプル間の関係)と自己符号化(サンプル内相関)の補完的インダクティブバイアスが表現品質に与える影響は何か?
  • RQ4ノイズ除去目的が、標準的な再構成で見逃されがちな高周波成分を捉えることで、特徴学習を向上させられるか?
  • RQ5JFT-300M のような大規模でキュレートされていないデータセットにおいて、個々のコンponents よりも統合手法がよりよくスケーリングするか?

主な発見

  • JFT-300M での事前学習において、CAN は ImageNet での線形プローブ評価で 75.4% のトップ-1正解率を達成し、SimCLR(73.4%)と MAE(64.1%)を上回りました。
  • ImageNet で微調整された ViT-L モデルでは、CAN は 86.1% のトップ-1正解率を達成し、SimCLR の 85.5% や MAE の 85.4% を上回りました。
  • ViT-L モデルにおいて、CAN は SimCLR よりも 70% の FLOPs を削減し、顕著な計算効率を示しました。
  • CAN は 7 つの分布シフトベンチマークで優れたロバストネスを示し、IN-v2、IN-Adversarial、ObjectNet など、他の挑戦的なデータセットでも SimCLR や MAE を上回りました。
  • 対照的損失と再構成損失の共同学習は、個別に学習する場合よりも両方の損失が低くなることを確認しており、それらの補完性を裏付けました。
  • 最適なパフォーマンスは 50% のマスキング率、0.03 の対照的損失重み、σ_max = 0.05 のノイズレベルで達成され、ノイズ除去損失重みの範囲内で性能が安定していました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。