Skip to main content
QUICK REVIEW

[論文レビュー] FLIS: Clustered Federated Learning via Inference Similarity for Non-IID Data Distribution

Mahdi Morafah, Saeed Vahidian|arXiv (Cornell University)|Aug 20, 2022
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

FLISは、非IIDデータ分布下でのパーソナライズ化と効率的な学習を可能にする、新しいクラスタリング型フェデレーテッドラーニングフレームワークを提案する。本手法は、プライベートデータにアクセスせずにサーバー側でモデルの推論類似度に基づいてクライアントをクラスタにグループ化する。これにより、SOTAのグローバルフェデレーテッドラーニングよりも最大40%高い精度を達成し、SOTAのパーソナライズドフェデレーテッドラーニングよりも最大30%高い精度を示す。さらに、事前にクラスタ数を定義する必要がなく、未学習のクライアントの参加にも柔軟に対応できる。

ABSTRACT

Classical federated learning approaches yield significant performance degradation in the presence of Non-IID data distributions of participants. When the distribution of each local dataset is highly different from the global one, the local objective of each client will be inconsistent with the global optima which incur a drift in the local updates. This phenomenon highly impacts the performance of clients. This is while the primary incentive for clients to participate in federated learning is to obtain better personalized models. To address the above-mentioned issue, we present a new algorithm, FLIS, which groups the clients population in clusters with jointly trainable data distributions by leveraging the inference similarity of clients' models. This framework captures settings where different groups of users have their own objectives (learning tasks) but by aggregating their data with others in the same cluster (same learning task) to perform more efficient and personalized federated learning. We present experimental results to demonstrate the benefits of FLIS over the state-of-the-art benchmarks on CIFAR-100/10, SVHN, and FMNIST datasets. Our code is available at https://github.com/MMorafah/FLIS.

研究の動機と目的

  • 非IIDデータ分布に起因するフェデレーテッドラーニングの性能低下を是正すること。特に、グローバルモデルがローカルモデルに比べて性能を発揮しない状況を改善する。
  • プライベートデータを共有せずに、極端に偏ったまたは多様なデータ分布を持つクライアントに対してパーソナライズドモデル学習を可能にすること。
  • モデル重みや勾配ではなく、推論類似度に基づいてクライアントをクラスタリングするメカニズムを開発し、柔軟で適応可能なクラスタ形成を可能にすること。
  • 動的なクライアント参加(学習開始後に新規クライアントが参加する場合)をサポートし、既存のクラスタ構造を活用して迅速なパーソナライズを実現すること。
  • 事前にクラスタ数を定義する必要を排除することで、データスケイーの度合いが異なる状況に対しても強力な性能を発揮する方法を構築すること。

提案手法

  • FLISは、サーバーが保持する小規模なデータセット上でクライアントの推論結果を用いて、クライアント間の類似度スコアを計算し、類似度行列を構築する。
  • サーバーは、クライアントのプライベートデータにアクセスせずに、類似度行列に対してハードスレッショルド処理または階層的クラスタリングを適用し、クライアントをクラスタに割り当てる。
  • 各クラスタ内で独立してモデルアグリゲーションが行われ、各グループが自身のデータ分布に最適化されたパーソナライズドモデルを学習可能となる。
  • 各ラウンドでクライアントは、ローカル検証損失に基づいて最も性能の良いクラスタモデルを選択することで、パーソナライズドな適応を実現する。
  • 本フレームワークはオンラインで動的にクラスタを形成でき、新規クライアントが参加した場合でも、最も類似したクラスタを選択してパーソナライズを迅速に実現できる。
  • 本手法は極端に偏った非IIDデータおよびわずかに偏った非IIDデータの両方に対して強い性能を発揮し、クラスタ数の事前知識が不要である。

実験結果

リサーチクエスチョン

  • RQ1プライベートデータにアクセスせずに、クライアントモデル間の推論類似度を有効に活用して意味のあるクラスタにクライアントをグループ化できるか?
  • RQ2モデル重みや勾配に基づくクラスタリングと比較して、推論類似度に基づくクラスタリングは、パーソナライズド性と収束性においてどのように優れているか?
  • RQ3非IIDデータ環境下で、SOTAのグローバルおよびパーソナライズドフェデレーテッドラーニング手法と比較して、FLISは優れた性能を発揮できるか?
  • RQ4学習開始後に参加する未学習のクライアントに対しても、FLISは十分な一般化性能を示せるか?
  • RQ5推論類似度のしきい値βの最適値は何か?これはクラスタリングの正確性とモデル性能のバランスを取るために重要である。

主な発見

  • CIFAR-100およびFMNISTで非IIDラベルスケイー状況下において、FLISはSOTAグローバルフェデレーテッドラーニングベースライン(例:FedAvg, FedProx)よりも最大40%高いテスト精度を達成した。
  • FMNISTで20%の非IIDスケイー状況下では、FLIS(DC)は平均97.51%のローカルテスト精度を達成し、IFCA(96.29%)およびPer-FedAvg(89.88%)を上回った。
  • CIFAR-10で30%の非IIDスケイー状況下では、FLISはたった30回の通信ラウンドで収束し、IFCA や LG を含むすべてのSOTAベースラインを上回った。
  • 未学習のクライアントに対しても、FLISは高いパーソナライズド精度(FMNISTで97.51%)を達成し、新規参加者への一般化性能が優れていることを示した。
  • 最適な推論類似度しきい値βはデータセットに依存する(例:CIFAR-10ではβ=0.1、FMNISTではβ=0.5)が、これらの値で性能がピークに達し、クラスタリング誤差は最小限に抑えられた。
  • FLISは極端に偏った非IID環境およびわずかに偏った非IID環境の両方で強力な性能を維持しており、固定されたクラスタ数を必要とする従来手法とは異なり、柔軟性に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。