[論文レビュー] Masked Image Modeling with Denoising Contrast
本稿では、従来の画像トークナイザーに代わり、ノイズ除去対照学習を用い、画像内パッチ間の対照損失を唯一の目的関数とする、純粋なマスクド画像モデリング(MIM)手法ConMIMを提案する。非対称な画像摂動とモデルの進行速度を導入することで、追加データや事前学習段階なしに最先端の性能を達成した—ViT-Smallを用いたImageNet-1Kではトップ1正答率83.9%、ViT-Baseでは85.3%を達成した。
Since the development of self-supervised visual representation learning from contrastive learning to masked image modeling (MIM), there is no significant difference in essence, that is, how to design proper pretext tasks for vision dictionary look-up. MIM recently dominates this line of research with state-of-the-art performance on vision Transformers (ViTs), where the core is to enhance the patch-level visual context capturing of the network via denoising auto-encoding mechanism. Rather than tailoring image tokenizers with extra training stages as in previous works, we unleash the great potential of contrastive learning on denoising auto-encoding and introduce a pure MIM method, ConMIM, to produce simple intra-image inter-patch contrastive constraints as the sole learning objectives for masked patch prediction. We further strengthen the denoising mechanism with asymmetric designs, including image perturbations and model progress rates, to improve the network pre-training. ConMIM-pretrained models with various scales achieve competitive results on downstream image classification, semantic segmentation, object detection, and instance segmentation tasks, e.g., on ImageNet-1K classification, we achieve 83.9% top-1 accuracy with ViT-Small and 85.3% with ViT-Base without extra data for pre-training.
研究の動機と目的
- マスクド画像モデリングにおける別個の画像トークナイザーの必要性を排除するため、対照学習を事前学習目的関数に直接統合すること。
- 非対称な学習設計を用いて、ビジョントランスフォーマーのノイズ除去オートエンコーダー能力を向上させること。
- 対照学習をMIMフレームワーク内ですらっと再考することで、離散的トークナイゼーションを用いないにもかかわらず、既存のMIM手法を上回ることを示すこと。
- 小規模なビジョントランスフォーマーおよびYFCC15Mのような大規模で未加工のデータセットに対して、ConMIMの有効性を検証すること。
- 最近のMIMの台頭を踏まえ、対照学習が自己教師付き視覚表現学習における役割を再評価すること。
提案手法
- ConMIMは、マスクされたパッチの予測をノイズ除去対照学習タスクとして定式化し、対照損失のための動的キーを入力画像全体から生成する。
- 単一視点、二回の順方向伝搬を用いる:一つはマスクされた入力(パッチがマスクされたもの)で、もう一つは入力全体を用いて正例キーを生成する。
- 正例キーは、入力全体の同じ空間的位置からのパッチ表現である。負例キーは、同じ画像内の他の空間的位置からのものである。
- 非対称な画像摂動を適用する:入力全体には強力な増幅を、マスクされた入力には弱い増幅を適用することで、耐性を高める。
- 非対称なモデル進行速度を用いる:ゆっくりと更新されるモーメンタムエンコーダーが入力全体を処理し、安定で意味的に一貫したキー表現を生成する。
- 対照損失は、マスクされたパッチの予測表現とそれに対応する正例キーとの間で計算され、微細な視覚的文脈学習を促進する。
実験結果
リサーチクエスチョン
- RQ1離散的画像トークナイザーを一切用いずに、純粋なマスクド画像モデリングフレームワーク内において、対照学習を効果的に再生可能にすることができるか?
- RQ2非対称な画像摂動とモデル進行速度は、MIM事前学習の性能と一般化能力にどのように影響を与えるか?
- RQ3特に小規模なビジョントランスフォーマーにおいて、ConMIMはMAE や iBOT などの既存のMIM手法を上回るか?
- RQ4YFCC15M のような大規模で未加工のデータセットに対して、追加の監視信号なしにConMIMは効果的にスケーリング可能か?
- RQ5MIMにおける対照学習とオートエンコーディングの相対的寄与度は何か?そして、これらを最適に組み合わせる方法は何か?
主な発見
- ConMIMは、追加データやトークナイザーを一切用いずに、ViT-Small と ImageNet-1K データのみで、ImageNet-1K で83.9% のトップ1正答率を達成した。これは、BEiT や他のMIM手法を上回る。
- ViT-Base を用いることで、ConMIM は ImageNet-1K で85.3% のトップ1正答率に達し、大規模アーキテクチャでも優れた性能を示した。
- アブレーションスタディの結果、非対称なモデル進行速度を除去すると正答率が1.98%低下し、情報漏洩を防ぐ上でその重要性が明確になった。
- 非対称な画像摂動は性能を向上させる:入力全体に強力な増幅、マスクされた入力に弱い増幅を適用することで、対称的または逆転した設定よりも優れた結果が得られた。
- YFCC15M では、ViT-B/16 を用いて83.3% のトップ1正答率を達成し、SLIP(82.9%)および MAE(83.0%)を上回り、大規模データへのスケーラビリティを確認した。
- ConMIM の1エポックあたりの学習時間は、BEiT(1.0×)の1.05倍であり、二回の順方向伝搬によるわずかなオーバーヘッドにとどまり、実世界の展開においても効率的で実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。