[論文レビュー] Learning Visual Representation from Modality-Shared Contrastive Language-Image Pre-training
本稿では、視覚と言語エンコーダー間でほとんどのパラメータを共有する対照的事前学習に基づく統合的トランスフォーマー・アーキテクチャである、モダリティ共有対照的言語・画像事前学習(MS-CLIP)を提案する。自己注意機構とフィードフォワード重みをモダリティ間で共有しながら、軽量なモダリティ固有モジュールを用いることで、パラメータ数を減らしながらも、vanilla CLIPに比べてゼロショットImageNet精度で13%の相対的向上を達成するとともに、モダリティ間の意味構造の整合性が向上する。
Large-scale multi-modal contrastive pre-training has demonstrated great utility to learn transferable features for a range of downstream tasks by mapping multiple modalities into a shared embedding space. Typically, this has employed separate encoders for each modality. However, recent work suggests that transformers can support learning across multiple modalities and allow knowledge sharing. Inspired by this, we investigate a variety of Modality-Shared Contrastive Language-Image Pre-training (MS-CLIP) frameworks. More specifically, we question how many parameters of a transformer model can be shared across modalities during contrastive pre-training, and rigorously examine architectural design choices that position the proportion of parameters shared along a spectrum. In studied conditions, we observe that a mostly unified encoder for vision and language signals outperforms all other variations that separate more parameters. Additionally, we find that light-weight modality-specific parallel modules further improve performance. Experimental results show that the proposed MS-CLIP approach outperforms vanilla CLIP by up to 13\% relative in zero-shot ImageNet classification (pre-trained on YFCC-100M), while simultaneously supporting a reduction of parameters. In addition, our approach outperforms vanilla CLIP by 1.6 points in linear probing on a collection of 24 downstream vision tasks. Furthermore, we discover that sharing parameters leads to semantic concepts from different modalities being encoded more closely in the embedding space, facilitating the transferring of common semantic structure (e.g., attention patterns) from language to vision. Code is available at \href{https://github.com/Hxyou/MSCLIP}{URL}.
研究の動機と目的
- 対照的事前学習において、視覚と言語エンコーダー間でトランスフォーマー・パラメータを共有することの実現可能性と性能への影響を調査すること。
- 最適なパフォーマンスを得るために、どのコンponents(例:注意機構、正規化、埋め込み)を共有すべきで、どのコンponentsをモダリティ固有に保つべきかを特定すること。
- 軽量なモダリティ固有モジュールが、クロスモダリティ一般化とモダリティ固有の特化のバランスを取ることで、性能向上に寄与するかどうかを評価すること。
- パラメータ共有が、視覚と言語モダリティ間で意味構造(例:注意パターン)をどれほど整合性を持って学習するかを分析すること。
提案手法
- 視覚と言語エンコーダー間で、自己注意機構とフィードフォワードネットワークを含む大多数のトランスフォーマー・コンponentsを共有する、モダリティ共有対照的事前学習フレームワーク(MS-CLIP)を提案する。
- 入力埋め込み、レイヤー正規化、出力プロジェクションはモダリティ固有であるべきであり、すべてのトランスフォーマー層は共有可能であると特定する。
- 2つの補助的設計を導入する:エアリー・スペシャリゼーション(最初のトランスフォーマー・ブロックをモダリティ固有のCNNとトランスフォーマー層に置き換える)および効率的並列ブランチ(視覚処理用に軽量なマルチスケールCNNを深度方向畳み込みアダプタで追加)。
- 大規模な画像キャプションデータセット(YFCC-100M および Laion-400M)を用いて、統合モデルの対照的損失を用いた事前学習を実施する。
- 視覚的・言語的コンセプト間の注意パターン類似度に基づく共通意味構造(CSC)距離メトリックを用いて、クロスモダリティ意味構造の整合性を測定する。
- 共有された注意ヘッドの可視化により、画像の「cat」とテキストの「cats」に注目するなど、モダリティ間で共参照関係を学習していることを示す。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマー層内のどのサブモジュールを視覚と言語エンコーダー間で共有すればパフォーマンスを最大化できるか?
- RQ2対照的事前学習設定において、視覚と言語エンコーダー間でどの程度のレイヤー共有が最適か?
- RQ3軽量なモダリティ固有コンポonentが、パラメータ共有を損なわずに、モダリティ固有の特性を反映させることでパフォーマンス向上に寄与できるか?
- RQ4パラメータ共有が、視覚と言語モダリティ間で意味構造(例:注意パターン)をどの程度整合性を持って学習するか?
主な発見
- MS-CLIPは、パラメータ数が少ないにもかかわらず、YFCC-100Mで事前学習した場合、vanilla CLIPに比べてゼロショットImageNet分類精度で13%の相対的向上を達成する。
- 24の下流ビジョンタスクにおける線形プローブ精度は、vanilla CLIPに比べて1.6ポイント向上する。
- 自己注意機構とフィードフォワード重みを含むすべてのトランスフォーマー層を共有することで、部分的レイヤー共有やNASベースの戦略よりも優れたパフォーマンスが得られる。
- 提案されたエアリー・スペシャリゼーションおよび補助的並列ブランチモジュールは、初期のモダリティ固有の抽象化と強化された空間モデリングを可能にすることで、さらなる性能向上をもたらす。
- 共通意味構造(CSC)距離はMS-CLIPで顕著に低減しており、共有パラメータがモダリティ間でより類似した注意パターンを促進していることを示している。
- 可視化により、共有された注意ヘッドが、画像の「cat」とテキストの「cats」に注目するなど、共参照関係を学習していることが確認され、クロスモダリティ整合性が実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。