[論文レビュー] Prompt Vision Transformer for Domain Generalization
この論文では、ドメイン固有のプロンプトとプロンプトアダプタを用いて、未学習ドメインへのゼロショット一般化を向上させる、ビジョントランスフォーマー向けの新しいドメイン一般化手法DoPromptを提案する。トレーニング時にドメインプロンプトを学習し、推論時にドメインアダプタを介してそれを動的に適応させることで、ViTを用いたSOTAと比較して平均1.4%の精度向上を達成し、前例の改善度の3.5倍にのぼる。
Though vision transformers (ViTs) have exhibited impressive ability for representation learning, we empirically find that they cannot generalize well to unseen domains with previous domain generalization algorithms. In this paper, we propose a novel approach DoPrompt based on prompt learning to embed the knowledge of source domains in domain prompts for target domain prediction. Specifically, domain prompts are prepended before ViT input tokens from the corresponding source domain. Each domain prompt learns domain-specific knowledge efficiently since it is optimized only for one domain. Meanwhile, we train a prompt adapter to produce a suitable prompt for each input image based on the learned source domain prompts. At test time, the adapted prompt generated by the prompt adapter can exploit the similarity between the feature of the out-of-domain image and source domains to properly integrate the source domain knowledge. Extensive experiments are conducted on four benchmark datasets. Our approach achieves 1.4% improvements in the averaged accuracy, which is 3.5 times the improvement of the state-of-the-art algorithm with a ViT backbone.
研究の動機と目的
- ドメインシフト下でのビジョントランスフォーマーのドメイン一般化性能の低さを解決すること。
- ソースドメインからのドメイン固有の知識を学習することで、ゼロショット一般化を向上させること。
- 推論時に未学習のターゲットドメインに対して、複数のソースドメイン知識を適応的に統合するメカニズムを構築すること。
- ネットワークパラメータの一部のみを用いるか、静的アンサンブルに依存する従来のドメイン一般化手法の限界を克服すること。
- ViTバックボーンのファインチューニングなしに、効果的なプロンプトベースの適応を可能にすること。
提案手法
- トレーニング時に画像パッチトークンの前にドメイン固有のプロンプトを付加し、自己注意機構を介して各プロンプトがドメイン固有の知識を学習できるようにする。
- 入力画像の特徴を入力として受け取り、推論時に複数のソースドメインプロンプトの重み付き組み合わせを生成するプロンプトアダプタネットワークを訓練する。
- ドメイン特徴を区別するための損失関数と、ターゲットドメインでの予測精度を向上させるための損失関数の2つを用いてプロンプトアダプタを最適化する。
- テスト時に適応されたプロンプトを用いて、ドメイン類似度に基づき複数のソースドメインからの知識を動的に統合する。
- プロンプトアダプタとドメインプロンプトを含む、モデル全体をエンドツーエンドでファインチューニングし、一般化性能を向上させる。
- ViTの自己注意メカニズムを活用して、プロンプトトークンがすべての層と相互作用できるようにし、豊富な特徴理解を可能にする。
実験結果
リサーチクエスチョン
- RQ1プロンプト学習は、ドメイン一般化の文脈でビジョントランスフォーマーがドメイン固有の知識を効果的に捉えられるか?
- RQ2学習可能なプロンプトアダプタは、ソースドメイン知識を動的に統合することでゼロショット一般化を向上させるか?
- RQ3ViTバックボーンを用いた場合、DoPromptはSOTA手法と比較して精度および一般化向上度においてどのように差をつけるか?
- RQ4ドメインプロンプトとプロンプトアダプタはそれぞれどれほど性能向上に寄与しており、両方とも必須であるか?
- RQ5プロンプトアダプタは、ソースドメインとターゲットドメイン間のドメイン類似度を正しく反映できるか?
主な発見
- DoPromptはViT-Baseを用いたSOTAベースラインに対して平均1.4%の精度向上を達成し、これは前例の最高改善度の3.5倍に相当する。
- プロンプトアダプタの有無による性能差は顕著で、OfficeHomeデータセットでアダプタを削除すると平均精度が1.2%低下する(76.0% → 74.8%)。
- アブレーションスタディにより、ドメインプロンプトとプロンプトアダプタの両方が不可欠であることが確認され、ドメインプロンプトを削除すると性能が1.7%低下した。
- 重み分析により、プロンプトアダプタがターゲットドメインと類似度の高いソースドメインに高い重みを割り当てることが示された(例:クリップアートをターゲットとした場合、アートドメインが優先される)。
- バックボーンのファインチューニングなしにプロンプトチューニングのみを適用した場合、精度が2.0%低下する(74.0% vs. 76.0%)ことから、完全なファインチューニングが必須であることが示された。
- 適応されたプロンプトは、すべてのターゲットドメインで個々のソースドメインプロンプトを上回る性能を示し、アダプタが文脈に適した優れたプロンプトを生成できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。