[論文レビュー] SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners
SupMAEは、可視パッチのサブセットを用いて、マスク画像再構成と教師あり分類を同時に最適化することで、ViTの事前学習を向上させる画期的な教師ありマスク自動エンコーダーを提案する。これは、MAEの3倍少ない1600エポックに比べて400エポックでImageNetで83.6%の精度を達成し、効率性と頑健性の両面で最先端の性能を発揮する。微調整や頑健性ベンチマークにおいても、MAEおよび標準的な教師あり事前学習を上回る性能を示す。
Recently, self-supervised Masked Autoencoders (MAE) have attracted unprecedented attention for their impressive representation learning ability. However, the pretext task, Masked Image Modeling (MIM), reconstructs the missing local patches, lacking the global understanding of the image. This paper extends MAE to a fully supervised setting by adding a supervised classification branch, thereby enabling MAE to learn global features from golden labels effectively. The proposed Supervised MAE (SupMAE) only exploits a visible subset of image patches for classification, unlike the standard supervised pre-training where all image patches are used. Through experiments, we demonstrate that SupMAE is not only more training efficient but it also learns more robust and transferable features. Specifically, SupMAE achieves comparable performance with MAE using only 30% of compute when evaluated on ImageNet with the ViT-B/16 model. SupMAE's robustness on ImageNet variants and transfer learning performance outperforms MAE and standard supervised pre-training counterparts. Codes are available at https://github.com/enyac-group/supmae.
研究の動機と目的
- マスク自動エンコーダー(MAE)が現在、自己教師付きマスク画像モデリングに依存しているが、教師あり事前学習がMAEの表現学習を改善できるかどうかを調査すること。
- MAEがグローバルな画像レベルの特徴を学習する能力に制限を受けるのを補うために、事前学習中にゴールデンラベルを統合すること。
- 画像内の空間的再冗長性を活用し、分類に可視パッチのサブセットのみを用いることで、訓練の効率性と特徴の頑健性を向上させること。
- 標準的な教師ありおよび自己教師付き事前学習と比較して、線形プローブや微調整を含む下流のビジョンタスクにおける転移学習性能を向上させること。
- マスクされた状態での再構成と分類の目的関数を組み合わせることで、よりサンプル効率的で頑健な特徴学習が達成できることを示すこと。
提案手法
- すべてのパッチやクラストークンではなく、可視パッチのサブセットのみを処理する並列的な教師あり分類ブランチをMAEに拡張する。
- ViTエンコーダーを用いて可視パッチから特徴を抽出し、平均プーリングによりグローバル画像特徴を取得して分類に使用する。
- 可視パッチ特徴と学習済みのマスクトークンを用いて、マスクされたパッチを再構成する小さなデコーダーを適用する。
- エポック全体で訓練する際、マスクされたパッチにおける再構成損失と分類ヘッドにおける交差エントロピー損失の組み合わせ損失を用いる。
- 事前学習中にランダムマスキングを適用することで、多様な訓練サンプルが得られ、強力な正則化として機能する。
- 微調整時には、再構成または分類ヘッドを一切使用せず、ViTエンコーダーのみを用いる。
実験結果
リサーチクエスチョン
- RQ1教師あり事前学習は、マスク自動エンコーダー(MAE)の性能と効率を向上させることができるか?
- RQ2MAEにおいて、分類に可視パッチのサブセットのみを用いることで、より高いサンプル効率性と頑健性が得られるか?
- RQ3転移学習および頑健性の観点から、SupMAEは標準的な教師あり事前学習および自己教師付きMAEと比較してどのように異なるか?
- RQ4マスクされた状態での再構成と分類の目的関数の組み合わせにより、より転送可能で頑健な特徴が得られるか?
- RQ5マスク自動符号化フレームワーク内でのグローバル平均プーリングが、グローバル表現学習に与える影響は何か?
主な発見
- SupMAEは、MAEが要する1600エポックの3倍少ない400エポックでImageNet-1Kでトップ-1精度83.6%を達成した。
- ViT-B/16を用いたImageNetで同等の性能を達成しながら、MAEと比較して計算コストを30%削減した。
- 自然なノイズが加えられたImageNetバージョンにおいて、MAEを平均1.8%上回り、優れた頑健性を示した。
- 5ショット設定の20のデータセットで、線形プローブの少サンプル設定においてMAEを平均14.5%上回った。
- ADE20Kのセマンティックセグメンテーションでは49.0%のmIoUを達成し、密度の高い予測タスクでも優れた性能を示した。
- 20の下流分類データセットにおいて50ショット微調整で20のうち13の最高精度を記録し、MAEおよびMoCo-v3を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。