Skip to main content
QUICK REVIEW

[論文レビュー] Multitask Vision-Language Prompt Tuning

Sheng Shen, Shijia Yang|arXiv (Cornell University)|Nov 21, 2022
Multimodal Machine Learning Applications被引用数 13
ひとこと要約

本稿では、複数のソースタスクにおける共有プロンプトの初期化と複数タスクのプロンプト適応を通じて、タスク間の知識を共有することにより、視覚言語モデルの少サンプル適応性を向上させる、新しいフレームワークであるマルチタスク視覚言語プロンプトチューニング(MVLPT)を提案する。複数のソースタスクにおいて同時にプロンプトを学習し、ターゲットタスクの微調整時に共有表現を活用することで、MVLPTは20ショットのElevatorベンチマークで最先端の性能を達成し、20の視覚タスクにおけるタスク間一般化性を向上させる。

ABSTRACT

Prompt Tuning, conditioning on task-specific learned prompt vectors, has emerged as a data-efficient and parameter-efficient method for adapting large pretrained vision-language models to multiple downstream tasks. However, existing approaches usually consider learning prompt vectors for each task independently from scratch, thereby failing to exploit the rich shareable knowledge across different vision-language tasks. In this paper, we propose multitask vision-language prompt tuning (MVLPT), which incorporates cross-task knowledge into prompt tuning for vision-language models. Specifically, (i) we demonstrate the effectiveness of learning a single transferable prompt from multiple source tasks to initialize the prompt for each target task; (ii) we show many target tasks can benefit each other from sharing prompt vectors and thus can be jointly learned via multitask prompt tuning. We benchmark the proposed MVLPT using three representative prompt tuning methods, namely text prompt tuning, visual prompt tuning, and the unified vision-language prompt tuning. Results in 20 vision tasks demonstrate that the proposed approach outperforms all single-task baseline prompt tuning methods, setting the new state-of-the-art on the few-shot ELEVATER benchmarks and cross-task generalization benchmarks. To understand where the cross-task knowledge is most effective, we also conduct a large-scale study on task transferability with 20 vision tasks in 400 combinations for each prompt tuning method. It shows that the most performant MVLPT for each prompt tuning method prefers different task combinations and many tasks can benefit each other, depending on their visual similarity and label similarity. Code is available at https://github.com/sIncerass/MVLPT.

研究の動機と目的

  • 視覚言語モデルにおける単一タスクプロンプトチューニングの限界を解決すること。これは、タスク間で共有される知識を活用できないためである。
  • プロンプトチューニング中にタスク間知識を活用することで、少サンプル適応の効率性と性能を向上させること。
  • 一般化性能を向上させるために、複数のタスクにわたるプロンプト初期化と適応を統合するフレームワークを構築すること。
  • マルチタスクプロンプトチューニングに適したタスクの組み合わせを特定するため、タスクの転送可能性を調査すること。
  • MVLPTが異なる視覚言語プロンプトチューニング手法やモデルサイズにおいてスケーラブルで効果的であることを実証すること。

提案手法

  • 2段階のMVLPTフレームワークを提案する:(1) 複数のソースタスクで訓練された共有プロンプトベクトルを用いたマルチタスクプロンプト初期化、(2) 関連するターゲットタスクをグループ化して共同チューニングを行うマルチタスクプロンプト適応。
  • 多様なソースタスク(例:11の画像分類タスク)から得た1つの転送可能なプロンプトを、新しいターゲットタスクの初期化に使用することで、初期化の質を向上させる。
  • グループ化されたターゲットタスク間で共同最適化を適用することで、プロンプト適応中に知識共有を可能にし、一般化性能を向上させる。
  • テキストプロンプトチューニング(MCoOp)、視覚プロンプトチューニング(MVPT)、統合視覚言語プロンプトチューニング(MUPT)の3つのプロンプトチューニングバリエーションをサポートし、すべてにマルチタスク学習を拡張する。
  • 文脈長、ソースタスク選定、モデルスケーリングに関する消去実験を通じて、設計選択の妥当性を検証する。
  • 20の視覚タスクを対象に400通りの組み合わせを含む大規模な分析を実施し、タスクの転送可能性を評価し、効果的なタスクグループ化を支援する。
Figure 1 : Our MVLPT approach (MCoOp, MVPT, MUPT) —which transfers a prompt learned from a mixture of source tasks (here, 11 Image Classification tasks) onto non-overlapped target tasks— outperforms vanilla CoOp [ 103 ] , VPT [ 36 ] on 12 Elevater tasks by a large margin, across all CLIP model sizes
Figure 1 : Our MVLPT approach (MCoOp, MVPT, MUPT) —which transfers a prompt learned from a mixture of source tasks (here, 11 Image Classification tasks) onto non-overlapped target tasks— outperforms vanilla CoOp [ 103 ] , VPT [ 36 ] on 12 Elevater tasks by a large margin, across all CLIP model sizes

実験結果

リサーチクエスチョン

  • RQ1複数のソースタスクから得たタスク間知識は、下流の視覚言語タスクにおけるプロンプト初期化を改善できるか?
  • RQ2関連するターゲットタスクを同時にチューニングするマルチタスクプロンプト適応は、単一タスクチューニングと比較して、より高い性能と一般化能力を達成できるか?
  • RQ3どの視覚タスクの組み合わせがマルチタスクプロンプトチューニングから最も利益を受けるか?また、視覚的類似性やラベル類似性などの要因は、転送可能性にどのように影響するか?
  • RQ4MVLPTは、異なる視覚言語モデルアーキテクチャ(例:ViT-B/32, ViT-B/16, ViT-L/14)や文脈長においてどのようにスケーリングするか?
  • RQ5ソースタスクの多様性と構成は、マルチタスクプロンプト初期化の性能にどのような影響を及えるか?

主な発見

  • MVLPTは、20ショットのElevatorベンチマークで、すべての単一タスクベースライン手法(CoOp, VPT, UPT)を上回り、それぞれ0.72%、1.73%、0.99%の向上を達成し、新たな最先端性能を記録した。
  • タスク間一般化ベンチマークでは、CoOp、VPT、UPTをそれぞれ1.73%、4.75%、4.53%向上させ、強力な一般化能力を示した。
  • 11のソースタスク(ImageNet1Kを含む)を用いたマルチタスクプロンプト初期化が最良の性能を達成し、MVPTとMUPTは単一タスクベースラインと比較して顕著な向上を示した。
  • 文脈長が長い(16トークン)と、MVPTとMCoOpの性能が向上するが、MUPTはわずかに悪化またはほとんど影響を受けないことが示され、統合チューニングでは文脈長に敏感である可能性がある。
  • 最も効果的なMVLPT設定はタスクの類似性に依存する:視覚的またはラベル類似性が高いタスクは、共有プロンプト学習からより大きな利益を受ける。
  • スケーリング実験の結果、MVLPTはモデルサイズ(ViT-B/32からViT-L/14まで)にかかわらず高い性能を維持しており、広範な適用可能性とパラメータ効率性を示している。
Figure 2 : An illustration of our multitask prompt initialization (left) and multitask prompt adaptation (right) approaches in MVLPT. Left : We learn single generic source prompt vector on various source tasks , which is then used to initialize the prompt for each single target task . Right : After
Figure 2 : An illustration of our multitask prompt initialization (left) and multitask prompt adaptation (right) approaches in MVLPT. Left : We learn single generic source prompt vector on various source tasks , which is then used to initialize the prompt for each single target task . Right : After

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。