Skip to main content
QUICK REVIEW

[論文レビュー] Where to Begin? On the Impact of Pre-Training and Initialization in Federated Learning

John Nguyen, Jianyu Wang|arXiv (Cornell University)|Oct 14, 2022
Privacy-Preserving Technologies in Data被引用数 13
ひとこと要約

本論文は、フェデレーテッドラーニングにおける事前学習とモデル初期化の影響を調査し、事前学習済みモデルから開始することで収束速度が著しく向上し、最終的な精度が最大40%も向上し、データおよびシステムの非イ.i.d.性に対してもより頑健であることを示している。事前学習初期化を用いる場合、適応的サーバ最適化手法(例:FedAdam)が非イ.i.d.性に配慮した手法よりもより重要であることが示され、ランダム初期化と事前学習初期化の両方の設定でフェデレーテッド最適化手法を評価することを提案している。

ABSTRACT

An oft-cited challenge of federated learning is the presence of heterogeneity. \emph{Data heterogeneity} refers to the fact that data from different clients may follow very different distributions. \emph{System heterogeneity} refers to the fact that client devices have different system capabilities. A considerable number of federated optimization methods address this challenge. In the literature, empirical evaluations usually start federated training from random initialization. However, in many practical applications of federated learning, the server has access to proxy data for the training task that can be used to pre-train a model before starting federated training. We empirically study the impact of starting from a pre-trained model in federated learning using four standard federated learning benchmark datasets. Unsurprisingly, starting from a pre-trained model reduces the training time required to reach a target error rate and enables the training of more accurate models (up to 40\%) than is possible when starting from random initialization. Surprisingly, we also find that starting federated learning from a pre-trained initialization reduces the effect of both data and system heterogeneity. We recommend that future work proposing and evaluating federated optimization methods evaluate the performance when starting from random and pre-trained initializations. We also believe this study raises several questions for further work on understanding the role of heterogeneity in federated optimization.

研究の動機と目的

  • モデル初期化(ランダム vs. 事前学習済み)がフェデレーテッドラーニングのパフォーマンスに与える影響を調査すること。
  • クロスデバイスフェデレーテッドラーニングにおけるデータおよびシステムの非イ.i.d.性に対して、事前学習が及ぼす影響を評価すること。
  • 既存のフェデレーテッド最適化手法が、事前学習の恩恵を受けるか、それとも非イ.i.d.性に配慮した設計を重視するかを特定すること。
  • 事前学習がフェデレーテッドラーニングにおける収束性と頑健性を向上させる理由について、実証的および理論的知見を提供すること。

提案手法

  • 著者らは、CIFAR-10、CIFAR-100、Stack Overflow(NLP)、Federated EMNISTの4つのベンチマークデータセットを用いて、15の最先端フェデレーテッド最適化手法について包括的な実験的調査を実施した。
  • 公開プロキシデータを用いた教師あり事前学習によって得られた事前学習済み重みとランダム初期化の両方を用いて、学習ダイナミクスと最終的なモデル精度を比較した。
  • 各手法およびデータセットについて、両初期化タイプごとに別々にハイパーパrameterをチューニングし、公平な比較を確保した。
  • 収束速度、最終テスト精度、クライアント更新のコサイン類似度、初期化時の最大ヘッセ固有値(滑らかさの指標)を測定した。
  • 結果の再現性を確保するため、オープンソースのFLSimフレームワークを用いた。
  • 理論的分析には、局所リプシッツ定数(最大ヘッセ固有値)とクライアント間の更新類似度の分析を併用した。

実験結果

リサーチクエスチョン

  • RQ1事前学習初期化とランダム初期化を比較した場合、フェデレーテッドラーニングモデルの収束速度と最終的精度に事前学習がどのように影響するか?
  • RQ2事前学習は、フェデレーテッドラーニングにおけるデータおよびシステムの非イ.i.d.性の悪影響をどの程度軽減するか?
  • RQ3事前学習初期化を用いる場合、クライアント最適化手法の選択がサーバ最適化手法の選択よりも重要であるか?
  • RQ4最大ヘッセ固有値(損失関数の滑らかさの代理指標)として測定した損失関数の滑らかさは、ランダム初期化と事前学習初期化でどのように異なるか?
  • RQ5事前学習初期化を用いた単純なローカルSGDは、より複雑な非イ.i.d.性に配慮したフェデレーテッド最適化手法を上回るか、同等の性能を発揮できるか?

主な発見

  • 事前学習済みモデルから開始することで、目標精度に到達するためのトレーニングラウンド数が削減され、最終的なモデル精度がランダム初期化と比較して最大40%向上した。
  • 事前学習初期化を用いる場合、適応的最適化手法と非適応的最適化手法の性能差が縮まり、サーバ側のFedAdamが非イ.i.d.性に配慮したクライアント手法よりもより重要性を増す。
  • 事前学習は、非イ.i.d.データおよびシステムの非イ.i.d.性の悪影響を顕著に軽減し、多様なクライアント設定においてモデル性能の安定性を向上させた。
  • 事前学習初期化では、最大ヘッセ固有値(局所滑らかさの指標)が一貫して小さく、より良好に条件付けられた損失関数の形状を示した。
  • 事前学習初期化から出発するクライアント更新は、コサイン類似度が高く、非イ.i.d.環境下での高速収束と向上した頑健性を説明できる。
  • 単純なローカルSGDでも、事前学習初期化を用いることで、より複雑なローカル最適化手法と同等またはそれ以上の性能を発揮した。これは、事前学習がクライアント側の高度な最適化の必要性を低減することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。