[論文レビュー] Extreme Masking for Learning Instance and Distributed Visual Representations
ExtreMAは、自己教師あり視覚表現学習のための新しい手法を提案する。この手法では、Siamese表現学習のためのデータ拡張として極端なマスキング(75%-90%)を用い、シンプルなBYOLの目的関数に基づいて、学生ネットワークがマスキングされた入力から全体的な画像表現を予測するように学習させる。このアプローチは、ImageNet、ADE20K、COCOの各データセットで、線形プローブと転移性能において最先端の性能を達成しており、MAE や DINO よりもはるかに少ない計算コストで優れる。
The paper presents a scalable approach for learning spatially distributed visual representations over individual tokens and a holistic instance representation simultaneously. We use self-attention blocks to represent spatially distributed tokens, followed by cross-attention blocks to aggregate the holistic image instance. The core of the approach is the use of extremely large token masking (75\%-90\%) as the data augmentation for supervision. Our model, named ExtreMA, follows the plain BYOL approach where the instance representation from the unmasked subset is trained to predict that from the intact input. Instead of encouraging invariance across inputs, the model is required to capture informative variations in an image. The paper makes three contributions: 1) It presents random masking as a strong and computationally efficient data augmentation for siamese representation learning. 2) With multiple sampling per instance, extreme masking greatly speeds up learning and improves performance with more data. 3) ExtreMA obtains stronger linear probing performance than masked modeling methods, and better transfer performance than prior contrastive models.
研究の動機と目的
- 極端なマスキング(75%-90%)をSiamese表現学習のための新しいデータ拡張法として活用することの検討。
- 明示的なマスキングモデル化の監視なしに、分散表現(トークンレベル)と全体的表現(インスタンスレベル)の両方を学習すること。
- 高いマスキング比と1枚あたりの複数回のサンプリングを活用することで、学習の効率性と性能を向上させること。
- 大幅な計算コストの削減を実現しつつ、最新の対照的学習およびマスキングモデル化手法と同等またはそれ以上の転移性能を達成すること。
提案手法
- ExtreMAは、画像のパッチごとに空間的分散表現をエンコードするためのビジョントランスフォーマー(ViT)を用いる。
- クロスアテンションブロックが分散表現を集約して全体的なインスタンス表現を生成する。
- 入力画像に対して極端なマスキング(75%-90%)を適用し、データ拡張戦略として用いる。
- 学生ネットワークが、マスキングされたビューを入力として用い、完全な入力からのインスタンス表現を予測するように、シンプルなBYOL風の目的関数で学習する。
- 1枚の画像に対して複数のランダムマスクを適用することで、データの多様性を高め、収束を加速する。
- 教師ネットワークはモーメンタム更新により更新され、学生ネットワークは完全なビューとマスキングされたビューの間の対照的損失を最小化するように訓練される。
実験結果
リサーチクエスチョン
- RQ1極端なマスキング(75%-90%)は、Siamese表現学習のための効果的で効率的なデータ拡張法として機能するか?
- RQ2マスキングされたビューからの予測によってインスタンスレベルの表現を学習することは、従来のマスキングモデル化や対照的学習を上回るか?
- RQ3高いマスキング比と複数回のマスキング処理が、学習速度とモデル性能に与える影響は何か?
- RQ4ExtreMAは、構造的変更をほとんど行わずに、強力なゼロショットおよび微調整済みの転移性能を達成できるか?
主な発見
- ImageNet-1kで300エポック、1%のラベル付きデータのみを用いた場合、ExtreMAは67.3%の線形プローブ精度を達成し、同じ条件下でDINO(64.7%)とMAE(52.7%)を上回る。
- ADE20Kのセマンティックセグメンテーションにおいて、ImageNet-22kで事前学習した場合、30エポックで48.4 mIoUを達成し、1600エポックを要するMAE(48.1 mIoU)を上回る。
- COCOのオブジェクト検出において、ImageNet-22kで30エポック学習した場合、ExtreMAは48.5 APを達成し、300エポックで学習したMAE(48.4 AP)と400エポックで学習したDINO(46.8 AP)を上回る。
- ExtreMAはMAE や DINO よりも収束が早く、計算コストを大幅に削減しながら、MSN や MoCo-v3 と同等またはそれ以上の性能を発揮する。
- アテンションマップにおいて空間的対応関係が正確に保たれていることから、分散表現が意味的に意味があり、空間的に一貫性を持つことが示された。
- ExtreMAはデータスケーリングに強く、ImageNet-22kにデータを拡張した場合、ADE20Kで0.5 mIoUの性能向上が見られ、優れたデータ効率性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。