[論文レビュー] Federated Adaptive Prompt Tuning for Multi-Domain Collaborative Learning
本稿では、CLIPを用いたマルチドメイン画像分類のためのフェデレーテッドなアダプティブプロンプトチューニング手法であるFedAPTを提案する。クライアントは、凍結されたドメイン固有のキーと、学習されたアダプティブネットワークおよびメタプロンプトを共同で訓練する。学習されたアダプティブネットワークにより、各テストサンプルに対してパーソナライズされたプロンプトを動的に選択することで、10%未満のパラメータで完全微調整モデルを上回る性能を達成し、教師ありおよび教師なし設定の両方で多様なクライアントドメインにわたる優れた汎化性能を示す。
Federated learning (FL) enables multiple clients to collaboratively train a global model without disclosing their data. Previous researches often require training the complete model parameters. However, the emergence of powerful pre-trained models makes it possible to achieve higher performance with fewer learnable parameters in FL. In this paper, we propose a federated adaptive prompt tuning algorithm, FedAPT, for multi-domain collaborative image classification with powerful foundation models, like CLIP. Compared with direct federated prompt tuning, our core idea is to adaptively unlock specific domain knowledge for each test sample in order to provide them with personalized prompts. To implement this idea, we design an adaptive prompt tuning module, which consists of a meta prompt, an adaptive network, and some keys. The server randomly generates a set of keys and assigns a unique key to each client. Then all clients cooperatively train the global adaptive network and meta prompt with the local datasets and the frozen keys. Ultimately, the global aggregation model can assign a personalized prompt to CLIP based on the domain features of each test sample. We perform extensive experiments on two multi-domain image classification datasets across two different settings -- supervised and unsupervised. The results show that FedAPT can achieve better performance with less than 10\% of the number of parameters of the fully trained model, and the global model can perform well in diverse client domains simultaneously. The source code is available at \url{https://github.com/leondada/FedAPT}.
研究の動機と目的
- 異なるクライアントドメインにおける非IIDデータの影響により生じるドメイン間性能低下の課題に対処すること。
- CLIPのような強力な事前学習モデルを活用し、パラメータ数を極めて少ない数にチューニングすることで、フェデレーテッド学習における通信コストと訓練コストを低減すること。
- 各テストサンプルのドメイン固有特徴に基づいて、パーソナライズされたプロンプトを生成することにより、すべてのドメインで同時に分類精度を向上させること。
- プライバシーを保護する強固なフレームワークを構築し、生データを共有せずに教師ありおよび教師なし設定の両方で高い性能を維持すること。
提案手法
- サーバーがクライアントに固有の凍結キーを割り当て、学習中は固定されたままドメイン固有の埋め込みとして機能する。
- アダプティブネットワークが、入力画像のドメイン特徴に基づいて、最も関連性の高いキーを選択することで、動的なプロンプト生成を可能にする。
- メタプロンプトはグローバルに共有され、選択されたキーと要素ごとの積算により、各入力に対してパーソナライズされたプロンプトが生成される。
- アダプティブネットワークとメタプロンプトは、ローカルデータを用いたフェデレーテッド学習により共同で訓練され、通信されるのはネットワークとプロンプトのパラメータのみである。
- 温度ハイパーパrameterがキー選択の柔軟性を制御し、既存ドメインでのパフォーマンスと未学習ドメインへの汎化性能のバランスを取る。
- 推論時、アダプティブネットワークが各サンプルに対してキーを選択し、対応するプロンプトが凍結されたCLIPモデルに適用されて分類が実行される。
実験結果
リサーチクエスチョン
- RQ1ドメイン固有のキーを用いたアダプティブプロンプトチューニングは、固定プロンプトやグローバルプロンプトと比較して、マルチドメインフェデレーテッド画像分類の性能を向上させるか?
- RQ2軽量なアダプティブネットワークとメタプロンプトの使用により、FedAPTは顕著に少ない可学習パラメータ数で完全微調整モデルを上回る性能を達成できるか?
- RQ3アダプティブキー選択メカニズムは、既存ドメインおよび未学習ドメインでのパフォーマンスにどのように影響を与えるか?
- RQ4ラベルが利用できない教師なし設定でも、FedAPTは強力な性能を維持できるか?
- RQ5ローカル学習中に凍結キーを含めることで、ローカルモデルの最適化や一般化性能が制限されるか?
主な発見
- 教師あり設定において、FedAPTはOffice-Caltech10データセットでグローバルモデルの精度が67.39%に達し、パラメータ数がそれらの10%未満である完全微調整ResNet50およびViTモデルを上回った。
- 教師なし設定では、同じデータセットで68.26%の精度を達成し、PromptFL(67.26%)を上回り、優れたゼロショット汎化性能を示した。
- 温度τ=0.01のアダプティブネットワークは、既存ドメイン(例:ドメインiでは72.76%)でのパフォーマンスを向上させつつ、未学習ドメインへの汎化性能はほぼ変化させなかった。
- ドメイン固有のキーの使用により、それぞれのドメイン内でのパフォーマンスが顕著に向上した—例として、k番目のキーはk番目のドメインでの精度を、メタプロンプト単体を使用した場合と比較して最大15ポイント向上させた。
- アブレーションスタディの結果、キーの使用はローカルモデルの訓練を制限せず、キー有りと無しの両状況で同等のローカルモデルパフォーマンスを示した。
- 推論効率が著しく向上:1枚のGPU上で推論時間が30分から30秒に短縮され、GFLOPsはわずかに増加(FedAPT: 4.42 vs. ResNet50: 4.14)した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。