[論文レビュー] Scaling Language-Image Pre-training via Masking
本稿では、画像パッチの50–75%をランダムにマスキングすることで、CLIPのトレーニングを高速化するFast Language-Image Pre-training (FLIP)を提案する。この手法により、収束が速くなり、精度も向上する。FLIPは4億枚の画像・テキストペアで、最大3.7倍の高速化を達成し、多様な下流タスクにおいてCLIPのベースラインを上回る性能を示す。疎行列計算を用いた効率的な対照学習により、速度と性能の良好なトレードオフを実現している。
We present Fast Language-Image Pre-training (FLIP), a simple and more efficient method for training CLIP. Our method randomly masks out and removes a large portion of image patches during training. Masking allows us to learn from more image-text pairs given the same wall-clock time and contrast more samples per iteration with similar memory footprint. It leads to a favorable trade-off between accuracy and training time. In our experiments on 400 million image-text pairs, FLIP improves both accuracy and speed over the no-masking baseline. On a large diversity of downstream tasks, FLIP dominantly outperforms the CLIP counterparts trained on the same data. Facilitated by the speedup, we explore the scaling behavior of increasing the model size, data size, or training length, and report encouraging results and comparisons. We hope that our work will foster future research on scaling vision-language learning.
研究の動機と目的
- 大規模な視覚言語事前学習における高いウォルクロックトレーニングコスト、特にCLIPスタイルのモデルに対して解決を図ること。
- モデルの精度を損なわせることなく、効率的なスケーリング戦略を言語・画像事前学習に適用すること。
- パッチマスキングを活用した疎行列計算により、より高いスループットを実現し、トレーニングを高速化すること。
- モデルサイズ、データサイズ、トレーニング期間のスケーリングがFLIPの性能に与える影響を評価すること。
- マスキングが、標準的なCLIPトレーニングと比較して、トレーニング速度と精度のトレードオフをより良くするかを示すこと。
提案手法
- トレーニング中に画像パッチの50–75%をランダムにマスキングし、計算負荷を低減しながらテキストからの意味的スーパービジョンを維持する。
- マスキングされた画像パッチとそれに対応するテキスト記述との間で、CLIPと同様の対照学習目的関数を用いる。
- マスキングにより、最大4倍のバッチサイズが可能になり、メモリ増加は最小限に抑えられ、勾配の安定性と精度が向上する。
- LARSを用い、コサインスケジューリングによる学習率の減少、重み減衰、レイヤーごとの学習率の減少を適用し、収束性を向上させる。
- 画像キャプション、VQA、ゼロショット分類などの下流タスクにおいて、標準的なファインチューニングプロトコルに従い、エンドツーエンドでファインチューニングする。
- 画像キャプションのため、ViTエンコーダーの上にシーケンストゥシーケンスのトランスフォーマーデコーダーを訓練し、ティーチャーフォースティングとクロスエントロピー損失を用いる。
実験結果
リサーチクエスチョン
- RQ1事前学習中にパッチマスキングを適用することで、下流性能に悪影響を与えずにトレーニング時間を顕著に短縮できるか?
- RQ2マスキングは、対照的言語・画像事前学習における精度とスループットのトレードオフにどのように影響するか?
- RQ3FLIP手法を用いる場合、モデルサイズ、データサイズ、トレーニング期間のスケーリング法則は何か?
- RQ4同じデータで学習され、多様な下流タスクで評価された場合、FLIPはCLIPおよびその変種を上回る性能を示すか?
- RQ5計算コストの低減により、マスキングが大規模事前学習のより効率的な探索を可能にするか?
主な発見
- 256 TPU-v3コア上で、FLIPはCLIPと比較してウォルクロックトレーニング時間を3.7倍高速化し、同程度の精度に到達する。
- 同じトレーニングエポック数で、ViT-L/16においてFLIPはゼロショットImageNet-1K精度86.1%を達成したのに対し、CLIPは84.8%であった。
- LAION-400Mで事前学習したFLIPは、画像キャプション、VQA、ゼロショット分類の多様な下流タスクにおいて、OpenCLIPおよび再現したCLIPベースラインをすべてのベンチマークで上回った。
- FLIPを用いたデータスケーリングでは、追加のトレーニングコストなしに性能向上が得られ、好ましいデータスケーリング行動を示した。
- モデルスケーリングとデータスケーリングの両方が精度向上に寄与し、特にデータスケーリングが性能向上への効率的なパスを提供した。
- FLIPは、COCOおよびNoCapsベンチマークで強いゼロショット一般化性能を示し、画像キャプションおよびVQAの効率的なファインチューニングを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。