Skip to main content
QUICK REVIEW

[論文レビュー] Personalised Federated Learning On Heterogeneous Feature Spaces

Alain Rakotomamonjy, Maxime Vono|arXiv (Cornell University)|Jan 26, 2023
Privacy-Preserving Technologies in Data参考文献 61被引用数 5
ひとこと要約

本稿では、クライアントが異なるデータ表現を用いる異種の特徴空間を想定した、パーソナライズドなフェデレーテッドラーニングフレームワークであるFLICを提案する。クライアントのデータは学習可能な局所埋め込み関数を介して共有された潜在空間にマッピングされ、フェデレーテッドに学習されたワサーライン・バーリング・アンカーを用いて分布を整列させることで、データの非同一性にもかかわらず効果的なモデル集約と性能向上を実現する。

ABSTRACT

Most personalised federated learning (FL) approaches assume that raw data of all clients are defined in a common subspace i.e. all clients store their data according to the same schema. For real-world applications, this assumption is restrictive as clients, having their own systems to collect and then store data, may use heterogeneous data representations. We aim at filling this gap. To this end, we propose a general framework coined FLIC that maps client's data onto a common feature space via local embedding functions. The common feature space is learnt in a federated manner using Wasserstein barycenters while the local embedding functions are trained on each client via distribution alignment. We integrate this distribution alignement mechanism into a federated learning approach and provide the algorithmics of FLIC. We compare its performances against FL benchmarks involving heterogeneous input features spaces. In addition, we provide theoretical insights supporting the relevance of our methodology.

研究の動機と目的

  • クライアントが共通のデータスキーマを仮定するパーソナライズドなフェデレーテッドラーニングの限界に対処すること。これは実際にはしばしば現実的ではない。
  • クライアントが異なる特徴次元数や意味論を持つ場合に、パーソナライズドモデルを訓練する課題に取り組むこと。
  • 異種の生データ表現を持つクライアント間で、効果的な知識共有を可能にするフレームワークを開発すること。
  • 入力特徴が異なっていても、同じ意味論的クラスに属するデータが共有潜在空間内で近接にマッピングされることを保証すること。
  • パーソナライズドモデル学習を支援する、理論的裏付けが与えられた、フェデレーテッドに訓練された分布整列手法を提供すること。

提案手法

  • 各クライアントの生データを共有された低次元潜在空間にマッピングするための局所埋め込み関数を導入する。
  • 分布整列の基準として、フェデレーテッドに計算されたワサーライン・バーリングを用いて学習されるグローバルな潜在アンカー分布を定義する。
  • 各クライアントの埋め込みデータと共有アンカー分布との間のワサーライン距離を最小化するように、局所埋め込み関数を分布整列を用いて訓練する。
  • 分布整列メカニズムをパーソナライズドなFLフレームワークに統合し、局所モデルのパーソナライズとグローバルな一貫性の両立を可能にする。
  • クライアントが局所アンカー分布と埋め込み関数を更新し、サーバーが局所アンカーのバーリングを計算するフェデレーテッド最適化方式を採用する。
  • 合成データおよび実世界のデータセット(画像・キャプションのペアリング、テーブルデータなど)に本フレームワークを適用し、事前学習と参加率に関するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1特徴空間が非同一で、データ表現の次元数や意味論が異なるクライアントに対し、パーソナライズドなフェデレーテッドラーニングをどのように効果的に拡張できるか?
  • RQ2異なる入力表現を持つクライアント間で、同じ意味論的クラスのデータが共有潜在空間に整列するように、フェデレーテッドに潜在空間を学習できるか?
  • RQ3局所埋め込み関数の事前学習と、トレーニング中の更新が、モデル性能と一般化性能に与える影響は何か?
  • RQ4本FLICフレームワークにおけるクライアント参加率が収束性と性能に与える影響は何か?
  • RQ5ワサーライン・バーリングによる分布整列が、異種のFL設定においてモデルの精度と頑健性をどの程度向上させるか?

主な発見

  • 提案されたFLICフレームワークは、標準的なFLベンチマークと比較して、特にクライアントのデータスキーマが不一致であるような異種特徴空間設定において、顕著に性能を向上させる。
  • トイトイ・ラインアーマッピングデータセットでは、局所埋め込み関数を10〜50エポックで事前学習すると最適な性能が得られ、この範囲を超えると過学習が観察された。
  • モデルは異なるクライアント参加率に対しても頑健であるが、局所トレーニングエポック数が高すぎると過学習のため性能が低下する可能性がある。
  • t-SNE可視化では、異なるクライアントからのクラス条件付き分布がアンカー分布の平均に収束していることが確認され、効果的な分布整列が実現していることが裏付けられた。
  • 損失関数にアンカーとのワサーライン距離を組み込むことで、全体の損失値は増加するが、分布整列と一般化性能が向上した。
  • 本フレームワークは、キャプションに曖昧またはスパースなテキスト的ヒントがある場合でも、画像キャプション分類といった実世界のタスクに良好に一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。