Skip to main content
QUICK REVIEW

[論文レビュー] Federated Learning on Non-IID Data: A Survey

Hangyu Zhu, Jinjin Xu|arXiv (Cornell University)|Jun 12, 2021
Privacy-Preserving Technologies in Data参考文献 154被引用数 8
ひとこと要約

本サーベイは、フェデレーテッドラーニングにおける非i.i.d.(独立同一分布でない)データについて包括的な分析を提供し、水平的および垂直的FL設定におけるパrametricモデルおよび非パラメトリックモデルへの影響を検討する。データの偏りに起因する性能低下を緩和するための既存手法をレビューし、プライバシー、計算、通信のトレードオフを評価するとともに、パーソナライズドFL、ベンチマーキング、フェデレーテッドニューラルアーキテクチャサーチにおける主な未解決課題と今後の研究方向性を特定する。

ABSTRACT

Federated learning is an emerging distributed machine learning framework for privacy preservation. However, models trained in federated learning usually have worse performance than those trained in the standard centralized learning mode, especially when the training data are not independent and identically distributed (Non-IID) on the local devices. In this survey, we pro-vide a detailed analysis of the influence of Non-IID data on both parametric and non-parametric machine learning models in both horizontal and vertical federated learning. In addition, cur-rent research work on handling challenges of Non-IID data in federated learning are reviewed, and both advantages and disadvantages of these approaches are discussed. Finally, we suggest several future research directions before concluding the paper.

研究の動機と目的

  • 非i.i.d.データ分布が水平的および垂直的FLフレームワークにおけるフェデレーテッドラーニングのパフォーマンスに与える影響を体系的に分析すること。
  • データ共有、知識蒸留、パーソナライゼーション、クライアントクラスタリングを含む、非i.i.d.データを扱うための既存手法を分類・評価すること。
  • 非i.i.d. FL設定におけるモデルの精度、通信コスト、計算オーバーヘッド、プライバシー漏洩の間の重要なトレードオフを特定すること。
  • 垂直的FLおよびフェデレーテッドNASにおけるベンチマーキング、プライバシーの定量化、異種データのサポートに関する未解決課題を強調すること。
  • 標準化されたベンチマーク、プライバシーに配慮したメトリクス、非i.i.d.に配慮したフェデレーテッドニューラルアーキテクチャサーチを含む、今後の研究方向性を提案すること。

提案手法

  • 非i.i.d.データを水平的および垂直的FL設定に分類し、ラベルの偏り、コンセプトドリフト、特徴量の重複など、サブタイプを含む。
  • 非i.i.d.データがモデルの収束性およびパフォーマンスに与える影響を分析し、特に深層ニューラルネットワークおよび非パラメトリックモデルにおいて検証する。
  • 既存の緩和手法をデータレベル、モデルレベル、システムレベルのアプローチに分類し、レビューする。これには、ローカルファインチューニング、クライアントクラスタリング、パーソナライズドFLが含まれる。
  • 通信、計算、プライバシーのトレードオフに基づいて手法を評価し、多くの手法が精度を向上させる一方でプライバシーリスクを増加させることを強調する。
  • 実世界のデータ分布と合成的偏り生成法を用いた非i.i.d.影響の評価フレームワークを提案する。
  • 垂直的FLにおける非i.i.d.シナリオの分類体系(重複する特徴量、クラウドソーシングによる偏りなど)を導入し、従来の研究で十分に検討されていなかった分野をカバーする。

実験結果

リサーチクエスチョン

  • RQ1ラベルの偏りや特徴量の偏りなどの異なる種類の非i.i.d.データ分布(例:label skew, feature skew)は、水平的フェデレーテッドラーニングにおけるモデルの収束性とパフォーマンスにどのように影響を与えるか?
  • RQ2データ共有や知識蒸留のような非i.i.i.d. FL緩和技術における、パフォーマンスの向上とプライバシーリスクの間のトレードオフは何か?
  • RQ3なぜ標準的なフェデレーテッドアベレージングアルゴリズムは非i.i.i.d.データ下で失敗するのか?また、ローカルモデルにおける重みの乖離はどのように生じるのか?
  • RQ4特に重複する特徴量や異種の特徴量を有する垂直的フェデレーテッドラーニングにおいて、非i.i.d. FLのパフォーマンス評価における主な課題は何か?
  • RQ5フェデレーテッドニューラルアーキテクチャサーチ(FNAS)は非i.i.d.データに対応するためにどのように変更できるのか?また、この分野における未解決の研究課題は何か?

主な発見

  • 非i.i.d.データは、特に深層ニューラルネットワークにおいて、ローカルモデルの重みの乖離によりフェデレーテッドラーニングのパフォーマンスを顕著に低下させる。
  • ローカルファインチューニングやデータ共有のような技術は収束性を向上させるが、通信コストや計算コストの増加、またはデータプライバシーの損なわれることを伴うことが一般的である。
  • パーソナライゼーションやクライアントクラスタリング手法は、元来のFLフレームワークを変更し、すべてのクライアントに同一のグローバルモデルを適用することが不可能になる。
  • 非i.i.d. FLのための既存のベンチマークは不十分であり、合成的データ分割では現実世界のデータ偏りのパターンを反映していない。
  • データ共有や知識蒸留手法に起因するプライバシー漏洩は、定量的測定が不十分であり、大きな未解決課題である。
  • 重複する特徴量や属性-ラベルの偏りを有する垂直的FLは、実世界の応用において一般的であるにもかかわらず、依然として十分に調査されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。