[論文レビュー] TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight Inheritance
TinyCLIPは、アフィニティ模倣とウェイトインheritanceを活用して、CLIPのような大規模なビジョン・ランゲージモデルを圧縮する画期的なクロスモダリティ・ディスティルレーション手法を提案する。教師モデルのクロスモダリティ特徴の整合性をアフィニティ空間で模倣し、教師モデルの事前学習済みウェイトを学生モデルにインheritすることで、TinyCLIPは最先端のゼロショット性能を達成した—パラメータ数が元のCLIP ViT-B/16の8.9%(8.9Mパラメータ)にまで削減されたにもかかわらず、ImageNetにおけるトップ1精度は41.1%を維持した。
In this paper, we propose a novel cross-modal distillation method, called TinyCLIP, for large-scale language-image pre-trained models. The method introduces two core techniques: affinity mimicking and weight inheritance. Affinity mimicking explores the interaction between modalities during distillation, enabling student models to mimic teachers' behavior of learning cross-modal feature alignment in a visual-linguistic affinity space. Weight inheritance transmits the pre-trained weights from the teacher models to their student counterparts to improve distillation efficiency. Moreover, we extend the method into a multi-stage progressive distillation to mitigate the loss of informative weights during extreme compression. Comprehensive experiments demonstrate the efficacy of TinyCLIP, showing that it can reduce the size of the pre-trained CLIP ViT-B/32 by 50%, while maintaining comparable zero-shot performance. While aiming for comparable performance, distillation with weight inheritance can speed up the training by 1.4 - 7.8 $ imes$ compared to training from scratch. Moreover, our TinyCLIP ViT-8M/16, trained on YFCC-15M, achieves an impressive zero-shot top-1 accuracy of 41.1% on ImageNet, surpassing the original CLIP ViT-B/16 by 3.5% while utilizing only 8.9% parameters. Finally, we demonstrate the good transferability of TinyCLIP in various downstream tasks. Code and models will be open-sourced at https://aka.ms/tinyclip.
研究の動機と目的
- CLIPのような大規模ビジョン・ランゲージモデルの高い計算コストとストレージコストを軽減するため、効率的なモデルディスティルレーションを可能にすること。
- マルチモーダルな設定における単一モーダルディスティルレーションの限界を克服し、知識伝達中にクロスモダリティ相互作用を保存すること。
- 教師モデルからの事前学習済みウェイトを新しいウェイトインheritance機構を通じて活用することで、ディスティルレーション効率を向上させること。
- マルチステージプログレッシブディスティルレーションを導入することで、顕著な性能低下を伴わず極端なモデル圧縮を実現すること。
- ゼロショットおよび下流のビジョン・ランゲージタスクにわたる、ディスティルされたモデルの汎用性を高めること。
提案手法
- アフィニティ模倣は、教師モデルの視覚的・言語的特徴の整合性行動を模倣するように学生モデルを訓練する。アフィニティ空間における画像とテキスト埋め込みのコサイン類似度の差を最小化することで実現される。
- ウェイトインheritanceは、教師モデルの事前学習済みウェイトを学生モデルに転送する。k次元またはk層のウェイトを手動で選択するか、学習可能なマスクを用いて重要なパラメータを特定する。
- 学習可能なマスクは、視覚的および言語的ブランチに独立して適用され、自動的に情報量の多いウェイトを同定・インheritする。これはモダリティ固有の重要度に適応する。
- マルチステージプログレッシブディスティルレーションは、極端な圧縮を段階的なステップに分割する。各学生モデルは構造が類似した教師モデルからウェイトをインheritするため、アーキテクチャの不一致を低減し、性能を向上させる。
- 本手法は、共通の学習目的を持つ二本のブランチアーキテクチャを採用する。対照的損失(画像・テキストペア)と、アフィニティ模倣による知識ディスティルレーションが含まれる。
- ディスティルレーションは、交差エントロピー損失とアライメント損失の組み合わせで最適化され、教師モデルの出力アフィニティ行列が学生モデルの監視信号として機能する。
実験結果
リサーチクエスチョン
- RQ1知識伝達中に視覚と言語モーダルの間の相互作用を明示的にモデル化することで、クロスモダリティディスティルレーションはどのように改善されるか?
- RQ2事前学習済み教師モデルからのウェイトインheritanceは、ビジョン・ランゲージモデルにおけるディスティルレーション効率と最終的性能にどのような影響を及えるか?
- RQ3マルチステージプログレッシブディスティルレーションは、ビジョン・ランゲージモデルにおける極端なモデル圧縮時の性能劣化を緩和できるか?
- RQ4従来のディスティルレーション手法(画像またはテキスト特徴のみに依存)と比較して、アフィニティ模倣はどのように異なるか?
- RQ5ディスティルされたTinyCLIPモデルは、多様な下流ビジョン・ランゲージベンチマークにおいて、強力なゼロショットおよび微調整性能を維持できるか?
主な発見
- TinyCLIPは、CLIP ViT-B/32のサイズを50%に圧縮しながら、ImageNetにおけるゼロショット性能を同等に維持した。
- ウェイトインheritanceを用いた学習は、初期から訓練する場合に比べて1.4倍から7.8倍の高速化を実現し、学習効率を顕著に向上させた。
- TinyCLIP ViT-8M/16は、ImageNetで41.1%のゼロショットトップ1精度を達成した。これは元のCLIP ViT-B/16(37.6%)を上回り、パラメータ数はその8.9%にまで削減された。
- TinyCLIP ViT-63M/32は、ImageNet-V2で55.7%のトップ1精度を達成し、OpenCLIP ViT-B/32(55.1%)およびCLIP ViT-B/32(56.0%)を上回った。
- マルチステージプログレッシブディスティルレーション戦略は、シングルステージディスティルレーションと比較して、ImageNetにおけるゼロショット精度を2.0%向上させた。知識の保持効果が裏付けられた。
- TinyCLIPモデルは、ゼロショットおよびリニアプローブ評価の両方において、23の下流データセットでOpenCLIP ViT-B/32と比較してトップ1精度が2%以内の範囲で優れた汎用性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。