Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Prompt Your Domain for Vision-Language Models

Guoyizhe Wei, Feng Wang|arXiv (Cornell University)|Oct 4, 2023
Privacy-Preserving Technologies in DataComputer Science被引用数 3
ひとこと要約

本稿では、クライアント間で異種のデータを扱う状況において、事前学習済みCLIPモデル内での視覚的・言語的プロンプトチューニングを組み合わせた、ドメインに配慮したフェデレーテッドラーニング手法であるFederated Dual Prompt Tuning(Fed-DPT)を提案する。ドメイン固有のプロンプトを学習し、クロスアテンションを用いて視覚的・言語的表現を整合化することで、ドメインシフトが生じる分散環境において、DomainNetで平均68.4%の精度を達成。元のCLIPよりも14.8ポイント高い。これは、分散環境下での高い耐障害性と通信効率性を示している。

ABSTRACT

Prompt learning has recently become a very efficient transfer learning paradigm for Contrastive Language Image Pretraining (CLIP) models. Compared with fine-tuning the entire encoder, prompt learning can obtain highly competitive results by optimizing only a small number of parameters, which presents considerably exciting benefits for federated learning applications that prioritizes communication efficiency. However, in this work, we identify that directly transferring prompt learning approaches into federated learning does not yield favorable results since the model often suffers from considerable domain gaps across different clients. To address this issue, we propose ADAPT, a novel domain-aware prompt learning approach that facilitates both intra- and inter-domain prompts across federated participants. The basic idea of ADAPT is that the prompted CLIP should detect the input image's domain correspondence and before making the prediction of its category. Extensive experiments of ADAPT demonstrate its significant efficiency and effectiveness in federated learning. For example, by learning and sharing only 0.08M parameters, our ADAPT attains a 68.4% average accuracy over six domains in the DomainNet dataset, which improves the original CLIP by a large margin of 14.8%.

研究の動機と目的

  • クライアントのデータが異なる視覚的スタイルを持つドメイン由来であるというドメインシフトの課題に対処すること。
  • ラベルベースの非i.i.d.パーティショニングを超えたデータの非同一性に起因する分散学習における一般化性と耐障害性を向上させること。
  • 主モデルの微調整を伴わせずに、多様なドメインで性能を維持できる、パラメータ効率的かつ通信に優れた手法を開発すること。
  • フェデレーテッドアveragingを用いて、ドメイン固有の適応を実現するとともに、グローバルモデルの一貫性を保つ、ドメインに配慮した適応を可能にすること。
  • マルチドメイン、分散型の画像分類において、既存のフェデレーテッドラーニングおよびCLIPベースのベースラインを上回ること。

提案手法

  • 事前学習済みのCLIPモデルを採用し、画像エンコーダーとテキストエンコーダーを固定した上で、クライント固有のドメインに適応するための学習可能な視覚的・言語的プロンプトを適用する。
  • 視覚的プロンプトはクライアント(ドメイン)ごとに学習されるが、テキストプロンプトは全クライアントで共有され、トレーニングの安定化を図るため、モーメンタムベースの指数移動平均によって更新される。
  • クロスアテンション機構を用いて、視覚的および言語的表現を動的に統合し、モダリティ間の特徴相関を強化する。
  • フェデレーテッドアveragingを用いて、ドメインごとに視覚的プロンプトのパラメータを集約し、ドメイン固有の適応を維持するとともに、グローバルな収束を実現する。
  • 本手法は、視覚入力(画像パッチ)用と言語入力(クラス記述)用の2種類のプロンプトチューニング戦略を採用する。両者をフェデレーテッド環境下でエンドツーエンドに最適化する。
  • 通信を最適化するため、プロンプトパラメータのみを送信することで帯域を削減し、プライバシーを保護する。

実験結果

リサーチクエスチョン

  • RQ1クライアントのデータが異なる視覚的ドメイン由来である状況において、CLIPを用いたデュアルプロンプトチューニングは、フェデレーテッドラーニングにおける一般化性を向上させ得るか?
  • RQ2ドメイン固有のプロンプト学習は、ドメインに依存しないプロンプトチューニングに比べ、ドメイン間の分布シフトをどのように処理するか?
  • RQ3モーメンタムベースのテキストプロンプト更新は、フェデレーテッド環境下でのモデル安定性と収束性にどのような影響を及ぼすか?
  • RQ4テキストプロンプトの長さは、ドメインに配慮したフェデレーテッドラーニングにおける性能と一般化性にどのような影響を及ぼすか?
  • RQ5ラベルの非i.i.d.パーティショニングを超えた、細分化されたクライアント分割のような、データの非同一性がさらに高まる状況下でも、Fed-DPTは性能を維持できるか?

主な発見

  • Fed-DPTは、DomainNetデータセットの6つのドメインにおいて平均68.4%の精度を達成。元のCLIPモデルよりも14.8ポイント高い。
  • FedAvgおよびFedProxよりも平均してそれぞれ16.8ポイントおよび16.0ポイント高い精度を達成。データの非同一性に対する優れた耐障害性を示している。
  • テキストプロンプトのモーメンタム更新を削除すると、精度が2.2%低下。フェデレーテッド最適化における安定的・段階的更新の重要性を裏付けている。
  • 全ドメインでテキストプロンプトトークンを一様に学習(ドメイン固有性の無効化)した場合、精度は4.4%低下。ドメインに配慮したチューニングの必要性を検証した。
  • 最適なテキストプロンプト長は16トークン。短いプロンプト(4トークン)は性能が劣り、長いプロンプト(32トークン)は過学習を引き起こし、精度が低下する。
  • 1ラウンドあたり1エポックの通信頻度が最適な性能を達成。0.5エポックに低下させても利益は得られず、2エポックに引き上げると0.5%の精度低下が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。