Skip to main content
QUICK REVIEW

[論文レビュー] MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training

Pavan Kumar Anasosalu Vasu, Hadi Pouransari|arXiv (Cornell University)|Nov 28, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

MobileCLIPは、強化されたマルチモーダルトレーニングを通じて、遅延と精度のトレードオフを改善した効率的でモバイル最適化された画像・テキストモデルのファミリを導入した。DataCompデータセットに、強力なCLIPモデルとキャプションモデルから得た合成キャプションおよび埋め込みを追加することで、軽量なビジョンおよびテキストエンコーダーの高速かつ高精度なトレーニングが可能となり、最大2.3倍高速な推論を実現した。これにより、ゼロショットタスクで最先端のパフォーマンスを達成した。

ABSTRACT

Contrastive pretraining of image-text foundation models, such as CLIP, demonstrated excellent zero-shot performance and improved robustness on a wide range of downstream tasks. However, these models utilize large transformer-based encoders with significant memory and latency overhead which pose challenges for deployment on mobile devices. In this work, we introduce MobileCLIP -- a new family of efficient image-text models optimized for runtime performance along with a novel and efficient training approach, namely multi-modal reinforced training. The proposed training approach leverages knowledge transfer from an image captioning model and an ensemble of strong CLIP encoders to improve the accuracy of efficient models. Our approach avoids train-time compute overhead by storing the additional knowledge in a reinforced dataset. MobileCLIP sets a new state-of-the-art latency-accuracy tradeoff for zero-shot classification and retrieval tasks on several datasets. Our MobileCLIP-S2 variant is 2.3$ imes$ faster while more accurate compared to previous best CLIP model based on ViT-B/16. We further demonstrate the effectiveness of our multi-modal reinforced training by training a CLIP model based on ViT-B/16 image backbone and achieving +2.9% average performance improvement on 38 evaluation benchmarks compared to the previous best. Moreover, we show that the proposed approach achieves 10$ imes$-1000$ imes$ improved learning efficiency when compared with non-reinforced CLIP training. Code and models are available at https://github.com/apple/ml-mobileclip .

研究の動機と目的

  • 低遅延および小サイズのモデルを実現するため、モバイルデプロイメントに適した効率的な画像・テキストエンコーダーを設計すること。
  • 標準的な対照的学習による小規模モデルの精度の低さという課題を克服し、トレーニング効率を向上させること。
  • パフォーマンスを損なわずに、効率的モデル開発のための計算コストとトレーニング時間を削減すること。
  • 属性、関係、順序予測などの複雑なビジョンタスクにおけるモデルのロバスト性および構成的理解を向上させること。
  • アーキテクチャのイノベーションとデータ強化を通じて、モバイルフレンドリーなCLIPモデルの新しいベンチマークを確立すること。

提案手法

  • 本手法は、強力なViT-B/16モデルのアンサンブルから得た合成画像キャプションおよびCLIP埋め込みで強化された、DataCompの強化版であるDataCompDRを導入した。
  • マルチモーダル強化トレーニングは、事前学習済みの画像キャプションモデルと複数のCLIPエンコーダーからの知識蒸留を活用し、学習効率を向上させる。
  • トレーニングプロセスは、知識注入の繰り返し計算オーバーヘッドを回避するため、強化データセットを複数のトレーニングイテレーションにわたって使用する。
  • MobileCLIPモデルは、構造的再パラメータライゼーションと畳み込み型トークンミキシングを組み合わせたハイブリッドCNN-Transformerアーキテクチャを採用し、遅延とモデルサイズを低減する。
  • 強化データセットの2つのバージョンを導入した:迅速プロトタイピング用のDataCompDR-12Mと、高精度トレーニング用のDataCompDR-1B。
  • 本アプローチにより、同じ計算予算において、標準的なCLIPトレーニングと比較して学習効率が10倍から1000倍向上した。

実験結果

リサーチクエスチョン

  • RQ1知識を強化したデータセットは、小規模でモバイル最適化された画像・テキストモデルの学習効率を顕著に向上させるか?
  • RQ2合成キャプションとCLIP埋め込みを用いたマルチモーダル強化トレーニングは、軽量モデルの精度向上と収束速度の向上をもたらすか?
  • RQ3MobileCLIPは、低遅延および小サイズを維持しながら、ゼロショット画像分類およびリtrievalタスクで最先端のパフォーマンスを達成できるか?
  • RQ4構成的理解ベンチマーク(例:ARO)において、MobileCLIPはViT-B/16 や SigLIP-B/16 といった強力なベースラインと比較してどの程度優れているか?
  • RQ5データ強化は、複雑な構成的ビジョンタスクにおけるロバスト性をどの程度向上させるか?

主な発見

  • MobileCLIP-S2は、以前の最良のViT-B/16ベースのCLIPモデルと比較して、2.3倍高速な推論と高い精度を達成した。
  • DataCompDR-1BでトレーニングされたMobileCLIP-Bは、38のベンチマークで平均して以前の最良のViT-B/16モデルと比較して2.9%高いパフォーマンスを示した。
  • MobileCLIP-S0は、標準のOpenAI ViT-B/16 CLIPモデルと同等の平均精度を維持しながら、5倍速く、3倍小さくなった。
  • AROベンチマークでは、MobileCLIP-BはVisual Genome RelationおよびAttributesデータセットでそれぞれ19.5%および12.4%高い精度を達成し、SigLIP-B/16を上回った。
  • Flickr30k-OrderではMobileCLIP-Bがrecall@1を69.7%向上、COCO-Orderでは50.3%向上し、SigLIP-B/16を上回った。
  • DataCompDR-1Bでトレーニングすると、1台の8× A100ノードを1日間使用するだけで、ゼロショットImageNet-1000のトップ1精度が61.7%に達し、計算予算が同じ場合に10倍~1000倍の学習効率向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。