Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Masking for Self-Supervised Learning

Yuge Shi, N. Siddharth|arXiv (Cornell University)|Jan 31, 2022
Domain Adaptation and Few-Shot Learning被引用数 14
ひとこと要約

ADIOSは、元の画像とマスクされた画像間の表現距離を最小化するエンコーダーと、その距離を最大化するマスク関数を敵対的目的で同時に学習する、画期的な自己教師あり学習フレームワークを提案する。この手法は意味的に意味のあるマスクを生成し、ImageNet100、CIFAR、iNaturalistを含む複数のベンチマークで、最先端のSSL手法を常に上回る性能を発揮する。畳み込み型バックボーンと組み合わせて使用可能であり、ビジョントランスフォーマーや画像デコーダーを必要としない。

ABSTRACT

We propose ADIOS, a masked image model (MIM) framework for self-supervised learning, which simultaneously learns a masking function and an image encoder using an adversarial objective. The image encoder is trained to minimise the distance between representations of the original and that of a masked image. The masking function, conversely, aims at maximising this distance. ADIOS consistently improves on state-of-the-art self-supervised learning (SSL) methods on a variety of tasks and datasets -- including classification on ImageNet100 and STL10, transfer learning on CIFAR10/100, Flowers102 and iNaturalist, as well as robustness evaluated on the backgrounds challenge (Xiao et al., 2021) -- while generating semantically meaningful masks. Unlike modern MIM models such as MAE, BEiT and iBOT, ADIOS does not rely on the image-patch tokenisation construction of Vision Transformers, and can be implemented with convolutional backbones. We further demonstrate that the masks learned by ADIOS are more effective in improving representation learning of SSL methods than masking schemes used in popular MIM models. Code is available at https://github.com/YugeTen/adios.

研究の動機と目的

  • マスク画像モデリング(MIM)におけるランダムまたはパッチワイズマスキングの限界を解決すること。これは、局所的な画素相関に依存するが、意味的推論には依存しない。
  • 自然言語処理における語のマスキングに類似した、意味的実体全体を遮断するマスクを学習することで、自己教師あり表現学習を向上させること。
  • ViTと畳み込み型バックボーンの両方と互換性を持つフレームワークを開発すること。これにより、パッチベースのトークナイゼーションに依存しなくなるようにする。
  • 意味的に意味のあるマスクが、ランダムまたは固定形状のマスクよりも顕著にSSL性能を向上させることを示すこと。
  • マスク関数の敵対的訓練が、表現学習のためのより効果的な増幅をもたらすことを示すこと。

提案手法

  • ADIOSは、推論モデル(エンコーダー)と遮断モデル(マスク生成器)の2つのコンponentsからなる、シアンジル型の敵対的フレームワークを採用する。
  • 遮断モデルは、U-Netベースのアーキテクチャを用いて、[0,1]の値をとる画像サイズのマスクを生成する。1はマスク領域を示す。
  • 推論モデルは、元の画像とマスクされた画像の表現間の対照的損失を最小化するように学習される。
  • 遮断モデルは、同じ対照的損失を最大化するように敵対的に学習され、エンコーダーが元の入力とマスクされた入力を区別しにくくする。
  • 空間的整合性と意味的整合性を向上させるために、マスクは完全結合型条件付きランダムフィールド(CRF)を用いて精錬される。
  • フレームワークはエンコーダーのみのモデルとして実装されており、デコーダーや視覚的トークナイザーを不要としている。これにより、畳み込み型バックボーンとの互換性が確保される。

実験結果

リサーチクエスチョン

  • RQ1意味的に意味のあるマスクを生成する敵対的訓練されたマスク関数は、ランダムまたは固定形状のマスクと比較して、自己教師あり表現学習を向上させることができるか?
  • RQ2意味的マスキングによる性能向上は、ImageNet100、CIFAR、iNaturalistを含む多様なデータセットおよび下流タスクにおいても成立するか?
  • RQ3ADIOSは、ビジョントランスフォーマーに依存せずに、畳み込みニューラルネットワークバックボーンに効果的に適用可能か?
  • RQ4学習されたマスクの品質は、オブジェクトの真値マスクと比較して、表現学習性能においてどの程度の差があるか?
  • RQ5生成的再構成目的関数と比較して、敵対的マスキング目的関数は、自己教師あり学習において機能的に優れているか?

主な発見

  • ADIOSはImageNet100分類タスクで最先端の性能を達成し、MAE や BEiT を含む既存のMIM手法を上回った。
  • CIFAR-10およびCIFAR-100では、ベースラインのMIM手法と比較して、線形プローブ精度が最大2.5%向上した。
  • iNaturalistおよびFlowers102における転移学習では一貫した向上が得られ、iNaturalist-2021では3%以上の向上が観察された。
  • ADIOSが生成するマスクは意味的に意味があり、表現学習の向上において真値オブジェクトマスクとほぼ同等の効果を示した。
  • アブレーションスタディにより、意味的マスクがランダムまたは固定形状のマスクを顕著に上回ることが確認され、MIMにおけるマスク設計の重要性が裏付けられた。
  • ADIOSは、対照的および非対照的メソッドを含む複数のSSL目的において性能向上を示し、汎用性の高さが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。