Skip to main content
QUICK REVIEW

[論文レビュー] Comparative assessment of federated and centralized machine learning

Ibrahim Abdul Majeed, Sagar Kaushik|arXiv (Cornell University)|Feb 3, 2022
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

この論文は、フェデレーテッドラーニング(FL)と集中型機械学習を比較し、非IIDデータ分布の課題にもかかわらず、小規模〜中規模モデルにおいてFLがコスト面で優位であることを示している。FLにおけるモデルサイズがデプロイコストに顕著な影響を与えることが明らかになり、特にラベルの偏りや1サンプルあたりのデバイスデータが限られる状況で収束に影響を及ぼす場合、効率性を確保するためには、モデル設計と圧縮が不可欠であることが示された。

ABSTRACT

Federated Learning (FL) is a privacy preserving machine learning scheme, where training happens with data federated across devices and not leaving them to sustain user privacy. This is ensured by making the untrained or partially trained models to reach directly the individual devices and getting locally trained "on-device" using the device owned data, and the server aggregating all the partially trained model learnings to update a global model. Although almost all the model learning schemes in the federated learning setup use gradient descent, there are certain characteristic differences brought about by the non-IID nature of the data availability, that affects the training in comparison to the centralized schemes. In this paper, we discuss the various factors that affect the federated learning training, because of the non-IID distributed nature of the data, as well as the inherent differences in the federating learning approach as against the typical centralized gradient descent techniques. We empirically demonstrate the effect of number of samples per device and the distribution of output labels on federated learning. In addition to the privacy advantage we seek through federated learning, we also study if there is a cost advantage while using federated learning frameworks. We show that federated learning does have an advantage in cost when the model sizes to be trained are not reasonably large. All in all, we present the need for careful design of model for both performance and cost.

研究の動機と目的

  • 非IIDデータ分布(特にラベルの偏りと1デバイス1ラベルの状況)がフェデレーテッドラーニングのパフォーマンスに与える影響を分析すること。
  • ラベルの偏りがある状況下で、フェデレーテッドSGDとフェデレーテッドアベーリージングを、集中型勾配降下法と比較して収束性と精度の観点から評価すること。
  • クラウドプラットフォーム上でのフェデレーテッドラーニングと集中型トレーニング・デプロイメントのコストインパクトを評価すること。
  • モデルサイズ、集約ラウンド数、1日あたりのラウンド数といった要因が、FLにおける主なコストドライバーであるかを特定すること。
  • パフォーマンスを損なわせることなく、モデルサイズとデプロイコストを低減するためのモデル圧縮および設計戦略を検討すること。

提案手法

  • ラベルの偏りや1デバイス1ラベルのデバイスを含むさまざまなデータ分布シナリオを用いて、フェデレーテッドおよび集中型トレーニングを実証的に評価した。
  • 確率的勾配降下法を用いたフェデレーテッドアベーリージングとフェデレーテッドSGDを用い、異なるデータ分割状況下での収束性と精度を比較した。
  • EC2インスタンスの実行時間、S3データ転送、モデル更新のメッセージペイロードサイズといったクラウドインfraストラクチャメトリクスを用いてコストをモデル化した。
  • モデルサイズ、集約ラウンド数、1日あたりのラウンド数を関数としてコストを分析し、主なコストドライバーを特定した。
  • 特徴量ハッシュ化やニューラルネットワークプルーニングといったモデル圧縮技術を検討し、モデルサイズとデプロイコストの低減を図った。
  • 差分プライバシーなどのセキュリティ対策とモデルパフォーマンスのトレードオフを評価し、匿名化の強度が高くなるとパフォーマンスが低下することを指摘した。

実験結果

リサーチクエスチョン

  • RQ1非IIDデータにおけるラベルの偏りは、フェデレーテッドラーニングの収束性とパフォーマンスに、集中型学習と比較してどのように影響を与えるか?
  • RQ21デバイスあたり1ラベルのみを持つ状況が、フェデレーテッドラーニングのパフォーマンスに与える影響は何か?
  • RQ3モデルサイズは、クラウドプラットフォーム上でのフェデレーテッドラーニングのトレーニングおよびデプロイコストにどのように影響を与えるか?
  • RQ4集約ラウンド数と1日あたりのラウンド数は、トレーニングコストとインfraストラクチャコストにどのように関与するか?
  • RQ5モデル圧縮および特徴量削減技術は、顕著なパフォーマンス損失を伴わずに、フェデレーテッドラーニングにおけるデプロイコストを効果的に低減できるか?

主な発見

  • 非IIDデータ、特に1ラベルまたは極端に偏ったラベル分布を伴うフェデレーテッドラーニングでは、集中型トレーニングと比較して収束が遅く、モデル精度も低下する。
  • 1デバイスあたりのサンプル数とラベル分布がモデルパフォーマンスに顕著に影響を与え、同じラベルのサンプルが多すぎると学習が劣化する可能性がある。
  • フェデレーテッドラーニングにおけるモデルデプロイコストは、主にS3のモデル配布用読み取りに起因し、モデルサイズがコストの主要因となる。
  • トレーニングコストは、モデルサイズ(例:15KB〜15,000KB)の変化にかかわらず比較的安定しているが、デプロイコストはモデルが大きくなると急激に上昇する。
  • 1日あたりの集約ラウンド数を増やすことで、EC2インスタンスの必要実行時間が短縮され、総トレーニングコストが低減される。
  • 特徴量ハッシュ化やニューラルネットワークプルーニングといったモデル圧縮技術は、パフォーマンスに顕著な損失を伴わずにモデルサイズを縮小し、デプロイコストを低減できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。