[論文レビュー] Adaptive Test-Time Personalization for Federated Learning
本稿では、ラベルなしのテストデータを前提とし、多様な分布シフトに対応するため、ソースクライントラインデータからモジュール固有の適応率を学習する、フェデレーテッドラーニングにおける新しいアダプティブテスト時パーソナライゼーションフレームワークであるATPを提案する。相互クライント間の分布シフトに基づいて動的に適応率を調整することで、ラベルシフト、画像劣化、ドメインシフトのあらゆる状況において、既存のTTA手法を上回る優れた汎化性能を達成する。
Personalized federated learning algorithms have shown promising results in adapting models to various distribution shifts. However, most of these methods require labeled data on testing clients for personalization, which is usually unavailable in real-world scenarios. In this paper, we introduce a novel setting called test-time personalized federated learning (TTPFL), where clients locally adapt a global model in an unsupervised way without relying on any labeled data during test-time. While traditional test-time adaptation (TTA) can be used in this scenario, most of them inherently assume training data come from a single domain, while they come from multiple clients (source domains) with different distributions. Overlooking these domain interrelationships can result in suboptimal generalization. Moreover, most TTA algorithms are designed for a specific kind of distribution shift and lack the flexibility to handle multiple kinds of distribution shifts in FL. In this paper, we find that this lack of flexibility partially results from their pre-defining which modules to adapt in the model. To tackle this challenge, we propose a novel algorithm called ATP to adaptively learns the adaptation rates for each module in the model from distribution shifts among source domains. Theoretical analysis proves the strong generalization of ATP. Extensive experiments demonstrate its superiority in handling various distribution shifts including label shift, image corruptions, and domain shift, outperforming existing TTA methods across multiple datasets and model architectures. Our code is available at https://github.com/baowenxuan/ATP .
研究の動機と目的
- 新しいラベルなしクライントが複雑な分布シフトに直面する状況において、フェデレーテッドモデルのパーソナライゼーションを解決すること。
- 単一ドメインでの学習を仮定する既存のテスト時適応(TTA)手法の限界を克服し、マルチクライントFL設定における柔軟性を欠いている問題に対処すること。
- ソースクライントライン間の分布シフトを観測することで、どのモデルコンponentを適応すべきかを学習し、モジュールに依存しない柔軟な適応を可能にすること。
- クロスデバイスフェデレーテッドラーニングの状況において、理論的裏付けがあり、頑健な非教師付きパーソナライゼーション手法を提供すること。
提案手法
- ATPは、非教師付きテスト時適応をシミュレートしてソースクライントラインで訓練し、パフォーマンスを最大化するようにモジュール固有の適応率を最適化する。
- 適応率はモデルモジュールごとに学習(例:バッチノーマライゼーション統計、重み)され、中央で集約されて汎化性能が向上する。
- 推論時、ターゲットクライントは学習済みの適応率を使用して、ラベルなしのテストデータのみでグローバルモデルを局所的にパーソナライズする。
- オンライン適応を強化するため、バッチごとに適応されたモデル状態を累積的に平均化する。
- 理論的分析により、複数のソースドメインの利用と低次元の適応率学習のおかげで、ATPが優れた汎化性能を示すことが示された。
- 負の適応率を許容することで、ラベルシフト下で直感に反するが効果的な「不整合化(disalignment)」が可能になる。
実験結果
リサーチクエスチョン
- RQ1フェデレーテッドラーニングにおいて、ラベルなしのテストデータに依存せずに、効果的で柔軟なモデルモジュール用の適応率を学習できるか?
- RQ2ソースドメイン間の相互クライント分布シフトを活用することで、テスト時FLにおける非教師付きパーソナライゼーションをどのようにガイドできるか?
- RQ3固定モジュールのTTA手法と比較して、適応的でモジュール固有の適応は、多様な分布シフトにおいて優れた性能を発揮するか?
- RQ4負の適応率はラベルシフト下で性能を向上させるか?もしそうなら、その理由は何か?
主な発見
- ATPは、CIFAR-10、CIFAR-100、Tiny ImageNetなど複数のデータセットおよびResNet、ビジョントランスフォーマーなどのモデルアーキテクチャにおいて、既存のTTA手法を一貫して上回る性能を発揮する。
- ラベルシフト下では、ATPはバッチノーマライゼーションのランニング統計に対して負の適応率を学習し、直感に反する「不整合化」によって精度を向上させる。
- 実験では、クライント参加率がC=15まで低下してもATPは頑健に汎化し、安定した収束と低テスト損失を示す。
- 完全参加および部分的参加の両状況において、トレーニング損失とテスト損失の曲線が安定して収束しており、強力な汎化性能と頑健性を示している。
- トイラベル例では、α = -0.5のATPがラベルシフト下で92%の精度を達成し、α = 0(89%)およびα = 1(73%)を上回り、負の適応率の有効性を検証した。
- ATPの理論的分析により、複数のソースドメインの利用と低次元の適応率学習のおかげで、強い汎化性能が保証されていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。