[論文レビュー] Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object Detection
この論文では、微調整時にランダムに抽出された入力埋め込みの25–50%のみを入力として与えることで、マスク画像モデリング(MIM)で事前学習されたシンプルなビジョントランスフォーマー(ViT)をオブジェクト検出に適応する新しいフレームワーク、MimDetを提案する。事前学習済みのパッチ化ステムを、マルチスケール特徴抽出を可能にするランダムに初期化された畳み込みステムに置き換えることで、MimDetはCOCOで54.3 APboxおよび48.2 APmaskを達成し、階層的スイントランスフォーマーを2.5および2.6 APそれぞれ上回る性能を発揮する。また、より単純な微調整レシピを用いることで、2.8倍速く収束する。
We present an approach to efficiently and effectively adapt a masked image modeling (MIM) pre-trained vanilla Vision Transformer (ViT) for object detection, which is based on our two novel observations: (i) A MIM pre-trained vanilla ViT encoder can work surprisingly well in the challenging object-level recognition scenario even with randomly sampled partial observations, e.g., only 25% $\sim$ 50% of the input embeddings. (ii) In order to construct multi-scale representations for object detection from single-scale ViT, a randomly initialized compact convolutional stem supplants the pre-trained large kernel patchify stem, and its intermediate features can naturally serve as the higher resolution inputs of a feature pyramid network without further upsampling or other manipulations. While the pre-trained ViT is only regarded as the 3$^{rd}$-stage of our detector's backbone instead of the whole feature extractor. This results in a ConvNet-ViT hybrid feature extractor. The proposed detector, named MIMDet, enables a MIM pre-trained vanilla ViT to outperform hierarchical Swin Transformer by 2.5 box AP and 2.6 mask AP on COCO, and achieves better results compared with the previous best adapted vanilla ViT detector using a more modest fine-tuning recipe while converging 2.8$ imes$ faster. Code and pre-trained models are available at https://github.com/hustvl/MIMDet.
研究の動機と目的
- MIMで事前学習されたシンプルなViTが、アーキテクチャの変更なしにオブジェクト検出に効果的に適応可能かどうかを調査すること。
- シンプルなViTにおける単一スケール特徴表現の課題を、マルチスケールオブジェクト検出において解決すること。
- 窓注意機構を避けることで、MIM事前学習と検出微調整の間の分布ギャップを最小限に抑えること。
- 従来のViTベースの検出器と比較して、より単純で高速な微調整レシピを用いて、効率的かつ高性能な検出を実現すること。
提案手法
- ViTの事前学習済みの大口径パッチ化ステムを、マルチスケール特徴を生成できるようにランダムに初期化されたコンactな畳み込みステムに置き換える。
- 微調整時に、MIMで事前学習されたViTエンコーダーに、ランダムに抽出された入力埋め込みの25–50%のみを入力とし、残りをマスクトークンとして扱う。
- 軽量なデコーダーを用いて、マスクされた入力を元に完全な特徴マップを再構築し、検出微調整中に暗黙的にMIMを実行する。
- 畳み込みステムの中間特徴を、標準の特徴ピラミッドネットワーク(FPN)の高解像度入力として利用することで、アップサンプリングの必要性を排除する。
- ViTエンコーダーを、完全な特徴抽出器としてではなく、ハイブリッドConvNet-ViTバックボーンの第3段階として扱う。
- 最小限のデータオーグメンテーションと36エポックの微調整スケジュールを用いて、標準のマスクR-CNNを検出ヘッドとして適用する。
実験結果
リサーチクエスチョン
- RQ1MIMで事前学習されたシンプルなViTが、部分的な入力シーケンスでのみ微調整された場合に、オブジェクト検出に効果的に一般化できるか?
- RQ2事前学習済みのパッチ化ステムをランダムに初期化された畳み込みステムに置き換えることで、オブジェクト検出における有効なマルチスケール表現学習が可能になるか?
- RQ3より少ないエポック数と少ないデータオーグメンテーションを用いた、より単純な微調整レシピでも、MIMで事前学習されたViTを用いて最先端の性能を達成できるか?
- RQ4MIM事前学習と検出微調整の間の分布ギャップは性能にどのように影響するか?窓注意機構を避けることで、そのギャップを軽減できるか?
主な発見
- MimDetは、36エポックの微調整のみを用いたベースサイズのモデルで、COCOオブジェクト検出およびインスタンスセグメンテーションにおいて54.3 APboxおよび48.2 APmaskを達成した。
- 同じ評価プロトコル下で、階層的スイントランスフォーマーを2.5 APboxおよび2.6 APmask上回った。
- より控えめな微調整レシピを用いても、以前の最高性能を示した適応済みシンプルなViT検出器と比較して、2.8倍速く収束した。
- 相対的位置バイアスが存在しない状態でも、強力な性能を維持した。これは、通常は顕著な訓練コストを伴うものである。
- 軽量な畳み込みステムと部分的入力サンプリングのみを用いて、最小限のアーキテクチャ変更で最先端の結果を達成した。
- MIMで事前学習されたシンプルなViTが、バックボーンの再設計や複雑な注意機構の導入なしに、オブジェクトレベル認識に効果的に活用可能であることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。