[論文レビュー] Prompt Tuning with Soft Context Sharing for Vision-Language Models
本稿では、学習可能なメタプロンプトとタスク名を入力として、タスク固有の連続的で柔ららかな共有プロンプトベクトルを生成する共有メタネットワークを用いる、ビジョン・ランゲージモデル向けの新しいマルチタスク・プロンプトチューニング手法、SoftCPTを提案する。実験の結果、3つの少サンプルデータセットにおいて、CoOp やハードプロンプト共有手法を著しく上回り、マルチタスク少サンプル画像認識における精度と安定性の向上を示した。
Vision-language models have recently shown great potential on many tasks in computer vision. Meanwhile, prior work demonstrates prompt tuning designed for vision-language models could acquire superior performance on few-shot image recognition compared to linear probe, a strong baseline. In practice, many few-shot tasks are inherently correlated, particularly within specialized domains. However, such information is overlooked previously. Inspired by the fact that modeling task relationship by multi-task learning can usually boost performance, we propose a novel method SoftCPT (Soft Context Sharing for Prompt Tuning) to tune pre-trained vision-language models on multiple target few-shot tasks jointly. Specifically, we design a task-shared meta network to generate prompt context for each task using task name together with a learnable task context as input. The parameters of this meta network as well as the task context are tuned on the joint training set of all tasks. As such, the prompt context of all tasks will be shared in a soft manner. Extensive experiments across four multi-task few-shot datasets covering 44 tasks and 1593 categories demonstrate that SoftCPT significantly outperforms single-task prompt tuning methods, highlighting the effectiveness of multi-task learning for vision-language prompt tuning. Code is available at https://github.com/kding1225/softcpt.
研究の動機と目的
- 少サンプルビジョン・ランゲージ学習における単一タスクプロンプトチューニングの限界を克服するため、タスク間の関係を活用すること。
- 特に相関するタスクを有する専門分野において、マルチタスク学習がプロンプトチューニングのパフォーマンスを向上させられるかどうかを検討すること。
- ハード制約なしに、複数のタスク間でプロンプト表現を柔らかく連続的に共有できる手法を設計すること。
- 関連するタスク間で同時にプロンプトをファインチューニングすることで、少サンプル画像認識における一般化性能と安定性を向上させること。
- マルチタスクプロンプトチューニングが、単一タスクチューニングやプロンプト転送手法を上回ることを検証すること。
提案手法
- タスク固有のプロンプトベクトルを生成するために、タスク共有メタネットワークを導入し、学習可能なメタプロンプトと事前に定義されたタスク名を入力とする。
- メタネットワークは、メタプロンプトとタスク名の連結をCLIPのテキストエンコーダーを用いて処理し、タスク固有の特徴を出力する。
- 軽量なサブネットワークがタスク特徴を、各タスクごとの連続的で柔らかなプロンプトベクトルに変換し、微分可能かつパラメータ共有を実現する。
- メタネットワークとメタプロンプトは、すべてのターゲット少サンプル学習セットの集合上で共同でファインチューニングされ、タスク間の知識移行が可能になる。
- SoftCPT はクラスに依存しないプロンプト戦略を採用しており、タスク内のすべてのクラスがメタネットワークによって生成された同一のプロンプトベクトルを共有する。
- ハードパラメータ共有を避ける代わりに、共有で学習可能なアーキテクチャを通じてタスク固有のプロンプトを学習することで、柔軟性とパフォーマンスの向上を実現する。
実験結果
リサーチクエスチョン
- RQ1マルチタスク学習を用いることで、プロンプトチューニングを通じてビジョン・ランゲージモデルにおける少サンプル画像認識性能を向上させられるか?
- RQ2タスク間でプロンプトパラメータを柔らかく連続的に共有することは、ハード共有や単一タスクチューニングと比較して、より優れた一般化性能をもたらすか?
- RQ3性能と安定性の観点から、提案手法 SoftCPT はプロンプト転送法やアンサンブル手法と比べてどのように差をつけるか?
- RQ4現実の少サンプルシナリオにおいて、プロンプト特徴から得られるタスク相関度が、真のタスク関連性とどの程度一致するか?
- RQ5ビジョン・ランゲージモデルの主要パラメータをファインチューニングせずに、共有メタネットワークが高品質なタスク固有プロンプトを効果的に生成できるか?
主な発見
- 16ショット設定下で、General-10、Plant-6、Fashion-20 データセットにおいて、それぞれ CoOp-CA よりも 0.73%、5.09%、0.93% の高い精度を達成した。
- General-10 では RSD(相対標準偏差)が 1.28%、Plant-6 では 3.70% と低く抑えられ、タスク間でのパフォーマンス安定性が優れていることが示された。
- General-10 において CoOp-MT よりも RSD を 12.4% 減少させ、マルチタスク設定におけるロバストネスの向上を実証した。
- SoftCPT-NATA の相関マップは、オラクルタスク類似度と 0.32 の係数を示し、CoOp-CA の -0.03 よりも顕著に高い値を示しており、真のタスク関連性との整合性が優れていることを示した。
- Oracle やアンサンブル手法によるプロンプト転送は、たとえば Plant-6 ではわずか ~0.07% の向上に留まり、一方 SoftCPT は顕著な向上を示しており、その優位性を裏付けた。
- SoftCPT-NATS は General-10 で 67.04% ± 0.23、Plant-6 で 67.13% ± 1.15 を達成し、両方の精度と安定性において CoOp-CA や Oracle ベースラインを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。