[論文レビュー] SimMIM: A Simple Framework for Masked Image Modeling
SimMIMは、ランダムにマスクされた画像パッチから、軽量な線形ヘッドとℓ₁損失を用いて生のピクセル値を回帰することで、最先端の性能を達成するシンプルなマスク画像モデリングフレームワークを提案する。ImageNet-1Kでは、ViT-Bを用いて83.8%のトップ1精度を達成し、SwinV2-Hを用いて87.1%を達成しており、従来の手法を上回る性能を発揮しながら、離散的VAEやブロック単位のマスキングといった複雑な設計を排除している。
This paper presents SimMIM, a simple framework for masked image modeling. We simplify recently proposed related approaches without special designs such as block-wise masking and tokenization via discrete VAE or clustering. To study what let the masked image modeling task learn good representations, we systematically study the major components in our framework, and find that simple designs of each component have revealed very strong representation learning performance: 1) random masking of the input image with a moderately large masked patch size (e.g., 32) makes a strong pre-text task; 2) predicting raw pixels of RGB values by direct regression performs no worse than the patch classification approaches with complex designs; 3) the prediction head can be as light as a linear layer, with no worse performance than heavier ones. Using ViT-B, our approach achieves 83.8% top-1 fine-tuning accuracy on ImageNet-1K by pre-training also on this dataset, surpassing previous best approach by +0.6%. When applied on a larger model of about 650 million parameters, SwinV2-H, it achieves 87.1% top-1 accuracy on ImageNet-1K using only ImageNet-1K data. We also leverage this approach to facilitate the training of a 3B model (SwinV2-G), that by $40 imes$ less data than that in previous practice, we achieve the state-of-the-art on four representative vision benchmarks. The code and models will be publicly available at https://github.com/microsoft/SimMIM.
研究の動機と目的
- 離散的VAEやクラスタリング、ブロック単位のマスキングといった複雑なコンponentsを排除することで、マスク画像モデリングを単純化すること。
- ランダムマスキング、生のピクセル値の回帰、軽量ヘッドといったシンプルな設計が強力な表現学習をもたらすかどうかを調査すること。
- データ効率の良い学習を含め、多様なビジョンタスクおよびモデルスケールにおけるSimMIMの有効性を評価すること。
- より複雑な自己教師あり手法と同等またはそれを上回る性能を達成できる最小限の設計選択肢が有効であることを示すこと。
提案手法
- 固定されたパッチサイズ(例:32×32)と10%〜70%のマスキング比を用いて、画像パッチをランダムにマスクする。
- 軽量な1層フィードフォワードヘッドを用いて、マスクされたパッチの元のRGBピクセル値を直接回帰予測する。
- 予測値と真値ピクセル値の間の単純なℓ₁損失を用いてモデルを学習する。
- 一般化性の評価のため、Vision Transformers(ViT、Swin)およびResNetsをバックボーンとして用いる。
- 推論時にマルチスケールテストを適用し、事前学習時に標準的なデータオーグメンテーションを用いる。
- ImageNet-1K分類、COCO検出、ADE20Kセグメンテーションを含む、下流タスクで評価する。

実験結果
リサーチクエスチョン
- RQ1大きなパッチサイズを用いたランダムマスキングは、ビジョントランスフォーマーにおける有効な表現学習をもたらすか?
- RQ2複雑なトークン化を伴う分類ベースのマスク画像モデリングと比較して、生のピクセル値の直接回帰は優れた性能を発揮するか?
- RQ3最小限の予測ヘッド(例:線形層)は強力な転移性能を達成するのに十分か?
- RQ4特にラベル付きデータが限られた状況において、SimMIMはモデルサイズやデータ環境のスケーリングにどのように対応するか?
- RQ5マスキング戦略(例:最近接の可視ピクセルとの平均距離)が下流性能に与える影響は何か?
主な発見
- ViT-Bを用いたImageNet-1Kでは83.8%のトップ1精度を達成し、前回のSOTAを+0.6%上回った。
- SwinV2-H(658Mパラメータ)を用いた場合、ImageNet-1Kデータのみを用いて87.1%のトップ1精度に到達した。
- 40倍も少ないラベル付きデータで学習された3BパラメータのSwinV2-Gモデルは、4つのビジョンベンチマークでSOTA性能を達成した。
- 線形予測ヘッドは、より深いヘッド(例:逆Swin-T)よりもImageNet-1Kで+0.4%、ADE20Kで+0.6%の性能を発揮し、シンプルさが一般化性能を向上させることを示唆している。
- 8〜256色のビンを用いたバイナリ化またはクラスタリングされた分類ターゲットと比較して、生のピクセル値の回帰とℓ₁損失は同等またはそれ以上の性能を示した。
- マスクされたパッチと可視パッチの間の平均距離(AvgDist)が約15ピクセルであると、最適な性能と強く相関しており、局所的文脈とグローバル構造のバランスが重要であることを示唆している。
![Figure 2 : Illustration of masking area generated by different masking strategies using a same mask ratio of 0.6: square masking [ 38 ] , block-wise masking [ 1 ] apply on 16-sized patches, and our simple random masking strategy on different patch sizes (e.g., 4, 8, 16 and 32).](https://ar5iv.labs.arxiv.org/html/2111.09886/assets/figs/mask_type.jpg)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。