[論文レビュー] Domain Adaptation via Prompt Learning
本稿では、微調整するパラメータを最小限に抑えることで、事前学習済みの視覚言語モデルを活用する、新しい教師なしドメイン適応手法であるドメイン適応によるプロンプト学習(DAPL)を提案する。特徴のドメイン間一致を図るのではなく、ドメイン固有のプロンプトコンテキストとドメインに依存しないプロンプトコンテキストを用いることで、意味的構造を保持し、分類精度を向上させる。この手法により、Office-HomeとVisDA-2017でそれぞれ74.5%および86.9%の最先端性能を達成した。
Unsupervised domain adaption (UDA) aims to adapt models learned from a well-annotated source domain to a target domain, where only unlabeled samples are given. Current UDA approaches learn domain-invariant features by aligning source and target feature spaces. Such alignments are imposed by constraints such as statistical discrepancy minimization or adversarial training. However, these constraints could lead to the distortion of semantic feature structures and loss of class discriminability. In this paper, we introduce a novel prompt learning paradigm for UDA, named Domain Adaptation via Prompt Learning (DAPL). In contrast to prior works, our approach makes use of pre-trained vision-language models and optimizes only very few parameters. The main idea is to embed domain information into prompts, a form of representations generated from natural language, which is then used to perform classification. This domain information is shared only by images from the same domain, thereby dynamically adapting the classifier according to each domain. By adopting this paradigm, we show that our model not only outperforms previous methods on several cross-domain benchmarks but also is very efficient to train and easy to implement.
研究の動機と目的
- 従来の教師なしドメイン適応(UDA)手法がドメイン間一致を強制することで意味的特徴構造を歪めてしまうという限界に対処すること。
- 特徴表現における意味的情報とドメイン情報の分離により、クラスの判別性を維持すること。
- 敵対的または統計的ドメイン一致を回避し、連続的プロンプトチューニングを用いるプロンプト学習フレームワークを提案すること。
- 事前学習済みの視覚言語モデルに対して最小限のパラメータ更新で高い性能を達成すること。
提案手法
- DAPLは、共通のドメインに依存しないコンテキスト、ドメイン固有のコンテキスト、およびクラスラベルトークンの3つの要素を持つプロンプトを設計する。
- ドメイン固有のコンテキストはドメインごとに学習され、各ドメイン固有の分布に応じた分類器の動的適応を可能にする。
- 一致するドメインとクラスペアでは画像とテキスト表現を一致させ、不一致ペアでは分離させる対照的学習目的関数を用いる。
- バックボーンとしてCLIPを採用し、プロンプト埋め込みのみを微調整することで、パrameter効率の高い手法を実現する。
- ドメインに依存しないプロンプトとドメイン固有のプロンプトを、一致するドメイン-クラスペア内での一致を促進する対照的損失関数を用いて同時に最適化する。
- 訓練中に信頼度しきい値を用いた疑似ラベル付けにより、ターゲットドメインのラベルを生成し、ロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ1プロンプト学習を教師なしドメイン適応に効果的に適用することで、ドメイン一致に起因する特徴空間の歪みを回避できるか?
- RQ2ドメイン固有のプロンプトコンテキストを導入することで、ドメイン不変特徴学習を必要とせずに一般化性能が向上するか?
- RQ3プロンプトによる意味的情報とドメイン情報の分離が、クラスの判別性およびモデルの精度に与える影響は何か?
- RQ4提案手法は、標準的なUDAベンチマークにおいてCLIPなどの強力なベースラインをどの程度上回るか?
主な発見
- DAPLはOffice-Homeデータセットで74.5%のトップ1精度を達成し、強力なCLIPベースラインを2.5ポイント上回った。
- VisDA-2017ベンチマークでは86.9%の精度を達成し、CLIPベースラインを2.5ポイント上回った。
- アブレーションスタディの結果、ドメイン固有のコンテキストが不可欠であることが確認され、ドメインに依存しないコンテキストのみを用いた場合に比べ1.4%の性能向上が得られた。
- ハイパーパramータの選択に対して頑健であり、疑似ラベル付けのしきい値τ(0.4から0.7の範囲)を変更しても性能の低下が最小限に抑えられた。
- さまざまなプロンプト長の組み合わせにおいて性能が安定しており、有効な連続的表現を学習するには少数のトークンで十分であることが示された。
- 可視化結果から、手動で作成したプロンプトに比べ、学習可能なプロンプトがより信頼性の高い予測をもたらすことが明らかになった。特に、曖昧または複雑な画像において顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。