[論文レビュー] Learning Domain Invariant Prompt for Vision-Language Models
この論文では、CLIPのようなビジョン・ランゲージモデル向けにドメイン不変のプロンプトを生成するメタラーニングベースのプロンプトチューニング手法、MetaPromptを提案する。これにより、未観測ドメインへの強力な一般化が可能になる。二重モダリティのプロンプトネットワークと非対称な対照的損失、エピソード学習を用いることで、MetaPromptは11のベース・トゥ・ニューグeneralizationベンチマークおよび4つのドメイン一般化ベンチマークで最先端の性能を達成し、既存手法を顕著に上回る。
Prompt learning is one of the most effective and trending ways to adapt powerful vision-language foundation models like CLIP to downstream datasets by tuning learnable prompt vectors with very few samples. However, although prompt learning achieves excellent performance over in-domain data, it still faces the major challenge of generalizing to unseen classes and domains. Some existing prompt learning methods tackle this issue by adaptively generating different prompts for different tokens or domains but neglecting the ability of learned prompts to generalize to unseen domains. In this paper, we propose a novel prompt learning paradigm that directly generates \emph{domain invariant} prompt that can be generalized to unseen domains, called MetaPrompt. Specifically, a dual-modality prompt tuning network is proposed to generate prompts for input from both image and text modalities. With a novel asymmetric contrastive loss, the representation from the original pre-trained vision-language model acts as supervision to enhance the generalization ability of the learned prompt. More importantly, we propose a meta-learning-based prompt tuning algorithm that explicitly constrains the task-specific prompt tuned for one domain or class to also achieve good performance in another domain or class. Extensive experiments on 11 datasets for base-to-new generalization and 4 datasets for domain generalization demonstrate that our method consistently and significantly outperforms existing methods.
研究の動機と目的
- 未観測ドメインおよび未観測クラスへのプロンプトチューニング済みビジョン・ランゲージモデルの一般化性能の低さを是正すること。
- 既存のプロンプト学習手法が、ドメイン外データへの一般化を明示的に強制できないという限界を克服すること。
- ドメインシフトに対して不変なプロンプトを生成しつつ、ドメイン内データの性能を維持するプロンプトチューニングパラダイムを開発すること。
- 少数のサンプル設定における一般化保証を向上させるために、メタラーニングとエピソード学習を活用すること。
- 画像およびテキストのプロンプトベクトルを統合的に学習し、不変性を強化する二重モダリティのプロンプトネットワークを設計すること。
提案手法
- 画像およびテキスト入力のための別々の連続的プロンプトベクトルを学習する二重モダリティのプロンプトチューニングネットワークを提案する。
- 事前学習済みモデルの表現を監視として用いる非対称な対照的損失を導入し、プロンプトの一般化を向上させる。
- 各エピソードでドメインまたはクラスのサブセットをサンプリングしてプロンプトチューニングを行うバッチ単位のエピソード学習戦略を採用する。
- メタラーニングを用いて、あるドメインでの性能が他の未観測ドメインに対しても良好に一般化されるようにプロンプトを最適化する。
- [43]に基づく理論的分析により、エピソード的プロンプトチューニングの一般化バウンドがO(1/√N)であることを正当化する。
- プロンプトチューニングをビジョン・ランゲージモデルの複数層(2~12層)にわたって実装し、深さの影響を検討する。
実験結果
リサーチクエスチョン
- RQ1メタラーニングベースのプロンプトチューニングは、ビジョン・ランゲージモデルにおける未観測ドメインおよび未観測クラスへの一般化を向上させることができるか?
- RQ2標準的なファインチューニングと比較して、提案されたエピソード学習戦略はプロンプト一般化にどのように影響するか?
- RQ3ドメイン不変プロンプト性能を達成するための最適なプロンプト長およびレイヤー設定は何か?
- RQ4非対称な対照的損失を備えた二重モダリティプロンプトネットワークは、単一モダリティまたは対称的アプローチよりも一般化性能を向上させるか?
- RQ5ゼロショットおよび少数ショット一般化設定において、MetaPromptは入力条件付きプロンプト学習手法と比較してどのように差をつけるか?
主な発見
- MetaPromptは11のベース・トゥ・ニューグeneralizationデータセットで最先端の性能を達成し、12層のプロンプト設定ではベースクラスで83.65%、ニュークラスで75.48%の精度を達成した。
- 4つのドメイン一般化データセットでは、10層および8つのプロンプトベクトルを用いて平均81.20%の精度を達成し、先行手法を上回った。
- エピソード学習戦略は、FGVCAircraft(ベース・トゥ・ニューグeneralization)およびVLCS(ドメイン一般化)において3%以上の性能向上を示し、分布シフトに対する強いロバストネスを示した。
- アブレーションスタディの結果、各モダリティで2つのプロンプトベクトルがベースクラスおよびニュークラスの性能のバランスを最適化するのに対し、4つのベクトルがドメイン一般化において最適であることが判明した。
- 全12層にわたるプロンプトチューニングが全体として最高の性能を達成し、両一般化設定において深さが増すにつれて精度が着実に向上した。
- 非対称な対照的損失は、事前学習済みモデルの表現を監視として活用することで、ドメイン内データへの過学習を低減し、一般化性能を顕著に向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。