Skip to main content
QUICK REVIEW

[論文レビュー] Delving Deeper into Data Scaling in Masked Image Modeling

Cheng-Ze Lu, Xiaojie Jin|arXiv (Cornell University)|May 24, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

この論文は、ウェブ収集されたCoyo-700Mデータセットを用いて、マスクド画像モデリング(MIM)におけるデータスケーリングを調査し、0.5M~100M枚の画像を含むサブデータセット上でViTモデルを訓練している。MIMの性能は1000万枚を超えると飽和し、強力なターゲットエンコーダーや長時間の事前学習を用いても、大多数の下流タスクで顕著な向上が得られないが、長尾分布のLVISではデータ量の増加に伴い性能が継続的に向上することが判明した。

ABSTRACT

Understanding whether self-supervised learning methods can scale with unlimited data is crucial for training large-scale models. In this work, we conduct an empirical study on the scaling capability of masked image modeling (MIM) methods (e.g., MAE) for visual recognition. Unlike most previous works that depend on the widely-used ImageNet dataset, which is manually curated and object-centric, we take a step further and propose to investigate this problem in a more practical setting. Specifically, we utilize the web-collected Coyo-700M dataset. We randomly sample varying numbers of training images from the Coyo dataset and construct a series of sub-datasets, containing 0.5M, 1M, 5M, 10M, and 100M images, for pre-training. Our goal is to investigate how the performance changes on downstream tasks when scaling with different sizes of data and models. The study reveals that: 1) MIM can be viewed as an effective method to improve the model capacity when the scale of the training data is relatively small; 2) Strong reconstruction targets can endow the models with increased capacities on downstream tasks; 3) MIM pre-training is data-agnostic under most scenarios, which means that the strategy of sampling pre-training data is non-critical. We hope these observations could provide valuable insights for future research on MIM.

研究の動機と目的

  • より大きなウェブ収集データセットに拡張することで、マスクド画像モデリング(MIM)手法のスケーラビリティを調査すること。特に、ImageNetのようなキュレート済みデータセットを超えること。
  • MIM事前学習が、特に下流タスクの性能に限って、無制限のデータを効果的に活用できるかどうかを評価すること。
  • 再構築ターゲットの品質とサンプリング戦略が、MIMにおけるデータスケーリングに与える影響を調査すること。
  • 多様な下流タスク、特に長尾ベンチマークを含めて、より大きなデータセットからの利点が持続するかどうかを特定すること。

提案手法

  • Coyo-700Mというウェブクロールされたデータセットから、0.5M、1M、5M、10M、100M枚の画像を含む複数のサブデータセットを構築し、体系的な事前学習を実施した。
  • 標準的なViTエンコーダーを用いたMAEフレームワークを採用し、異なるターゲットエンコーダー(例:CLIP-B/16、CLIP-L/14、EVA-G/14)を用いて再構築ターゲットを変更した。
  • 固定された学習ハイパーパrameterを用いて、これらのサブデータセット上でモデルを事前学習し、iNaturalist2018、ImageNet-5k、ImageNet-1k、LVISといった標準的な下流タスクで評価した。
  • 再構築品質と学習期間の影響を評価するため、異なるターゲットエンコーダーのサイズと事前学習期間を比較した。
  • クラスの不均衡下でのデータスケーリングの有効性をテストするため、LVISベンチマークを用いて長尾分布における一般化性能を評価した。
  • サンプリング戦略に関するアブレーションスタディを実施し、多様なウェブスケールデータサブセットにおいて、データに依存しない性質(data agnosticism)が成立することを示した。

実験結果

リサーチクエスチョン

  • RQ1マスクド画像モデリング(MIM)は、1000万枚を超えるデータで事前学習を継続しても、下流タスクの性能が向上を続けるか?
  • RQ2より大きなターゲットエンコーダーによる再構築ターゲットの品質向上が、MIM事前学習におけるデータスケーリングに与える影響は何か?
  • RQ3ウェブスケールのデータセットを用いる場合、データのサンプリング戦略に依存してMIM事前学習の性能が変化するか?
  • RQ4MIMにおけるデータスケーリングは、長尾の下流ベンチマーク(例:LVIS)においても顕著な向上をもたらすか?
  • RQ5より長い事前学習スケジュールは、大規模データセットで観察された性能の飽和を打破できるか?

主な発見

  • 標準的なベンチマーク(例:ImageNet-1k や iNaturalist2018)において、MIM事前学習の性能は約1000万枚の学習画像を超えると飽和し、より大きなデータセットでも顕著な向上は得られなかった。
  • より強力なターゲットエンコーダー(例:約10億パラメータのEVA-G/14)を用いることで、CLIP-L/14に比べてTop-1精度が0.3%向上したが、スケールにおける性能の飽和は打破されなかった。
  • 100M枚の画像で15エポック事前学習した結果、ImageNet-1kで86.94%のTop-1精度を達成したが、10エポックに延長しても性能に向上が見られず、収束していることが示された。
  • 長尾分布のLVISベンチマークでは、データ量の増加に伴い性能が継続的に向上した:AP<sup>box</sup>は0.5Mの際28.00から100Mの際47.30に上昇した。これは、希少カテゴリ検出におけるデータスケーリングの有効性を示している。
  • MIM事前学習は基本的にデータに依存しない(data-agnostic):ウェブスケールのデータサブセットにおいて、異なるサンプリング戦略が下流性能に顕著な影響を与えないことが判明した。
  • 広範な実験を行ったが、いかなる手法的変更(より強力なターゲット、長時間の学習、より良いサンプリング)でも、1000万枚を超えた際の性能の飽和は打破されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。