Skip to main content
QUICK REVIEW

[論文レビュー] CLIPA-v2: Scaling CLIP Training with 81.1% Zero-shot ImageNet Accuracy within a \$10,000 Budget; An Extra \$4,000 Unlocks 81.8% Accuracy

Xianhang Li, Zeyu Wang|arXiv (Cornell University)|Jun 27, 2023
Digital Media Forensic Detection被引用数 4
ひとこと要約

CLIPA-v2 は、事前学習および微調整の両段階に適用可能な逆スケーリング則を導入し、高性能な CLIP モデルの効率的訓練を可能にした。この知見を活用することで、H/14 モデルを用いて1万ドルの予算内で81.1%のゼロショット ImageNet 正解率を達成し、先行研究を1.0%上回り、学習コストを約39倍削減した。さらに4,000ドルを追加投資することで、正解率は81.8%まで向上した。

ABSTRACT

The recent work CLIPA presents an inverse scaling law for CLIP training -- whereby the larger the image/text encoders used, the shorter the sequence length of image/text tokens that can be applied in training. This finding enables us to train high-performance CLIP models with significantly reduced computations. Building upon this work, we hereby present CLIPA-v2 with two key contributions. Technically, we find this inverse scaling law is also applicable in the finetuning stage, enabling further reduction in computational needs. Empirically, we explore CLIPA at scale, extending the experiments up to the H/14 model with ~13B image-text pairs seen during training. Our results are exciting -- by only allocating a budget of \$10,000, our CLIP model achieves an impressive zero-shot ImageNet accuracy of 81.1%, surpassing the prior best CLIP model (from OpenCLIP, 80.1%) by 1.0% and meanwhile reducing the computational cost by ~39X. Moreover, with an additional investment of $4,000, we can further elevate the zero-shot ImageNet accuracy to 81.8%. Our code and models are available at https://github.com/UCSC-VLAA/CLIPA.

研究の動機と目的

  • 事前学習から微調整への逆スケーリング則の拡張により、CLIP 学習における計算コストを低減すること。
  • H/14 まで拡大したモデル、DataComp-1B まで拡大したデータセット、および約130億個のサンプルを学習対象とした長期間のスケジュールを想定した、CLIP 学習のスケーリング。
  • 制限された1万ドルの予算内で最先端のゼロショット ImageNet 正解率を達成し、高パフォーマンスな CLIP モデルの広範な利用を可能にすること。
  • マスキング戦略およびプログレッシブ微調整がモデル性能と効率に与える影響を調査すること。
  • ゼロショット分類、リtrieval、耐性テストベンチマークにおいて、CLIPA-v2 の性能を OpenCLIP や他の最先端モデルと比較すること。

提案手法

  • 逆スケーリング則を事前学習および微調整の両段階に適用し、より大きなモデルでも入力トークン数を減らしても性能劣化が生じないようにした。
  • プログレッシブ微調整スケジュールにおいて、最初の5億1200万個のサンプルでは224²解像度で30%のランダムマスキングを、最後の1億2800万個のサンプルでは336²解像度で40%のマスキングを実施した。
  • H/14 モデルを LAION-2B および DataComp-1B データセットで学習し、事前学習では84²の画像トークン、微調整では224²/336²の画像トークンを使用した。
  • 逆スケーリング行動を活用することで、事前学習段階でのシーケンス長を短縮しつつも高い正解率を維持し、学習効率を最適化した。
  • 二段階の微調整戦略を実装:まず低解像度とマスキングを適用し、その後に高解像度と学習率の低減を実施した。
  • JAX および PyTorch の両方でトレーニング済みモデルをオープンソース化し、再現性とさらなる研究を支援した。

実験結果

リサーチクエスチョン

  • RQ1CLIPA 事前学習で観察された逆スケーリング則を微調整段階に拡張することで、さらなる計算コスト低減が可能か?
  • RQ2モデルサイズ(H/14 まで)、データ(DataComp-1B まで)、および学習スケジュール(約130億個のサンプル)のスケーリングが、ゼロショット ImageNet 正解率に与える影響は?
  • RQ3微調整段階におけるマスキング戦略、解像度、学習率スケジュールの最適な組み合わせは何か? これにより正解率と効率を最大化できるか?
  • RQ4CLIPA-v2 は、ゼロショット正解率、耐性、学習コストの観点から OpenCLIP や他の最先端モデルと比較してどの程度優れているか?
  • RQ5データソース(LAION-2B 対 DataComp-1B)および解像度の段階的変更が、リtrieval および分類性能にどの程度影響を与えるか?

主な発見

  • CLIPA-v2 は、H/14 モデルを用いて1万ドルの予算内で81.1%のゼロショット ImageNet 正解率を達成し、OpenCLIP の80.1%を1.0%上回った。
  • 先行する最良の CLIP モデル(OpenCLIP G/14)と比較して、学習コストを約39倍削減した。
  • 追加の4,000ドル投資により、高解像度での事前学習とプログレッシブ微調整を実施し、ゼロショット ImageNet 正解率を81.8%まで向上させた。
  • 224² および 336² 解像度、30%/40% マスキング比を用いたプログレッシブ微調整は、フル解像度微調整と比較して0.2%の正解率向上と1.5倍の高速化を達成した。
  • 81.8% の H/14 モデルは、すべての耐性ベンチマークで OpenCLIP の80.1% G/14 モデルを上回った:IN-V2(+2.0%)、IN-A(+13.3%)、IN-R(+2.2%)、ObjectNet(+4.4%)、IN-SK(+3.9%)。
  • 優れたゼロショット分類性能および耐性を示したが、OpenCLIP の G/14 モデルは COCO および Flickr30k でのゼロショットリtrieval で依然として優位であった。これは、データ分布の違いがリtrieval 性能に有利に働いている可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。