[論文レビュー] Pisces: Efficient Federated Learning via Guided Asynchronous Training
Piscesは、収束保証付きのガイド付き参加者選択メカニズムを用いて、高品質なクライアントを知的に選択し、動的にスタリネスを制限することで、非同期フェデレーテッドラーニング(FL)システムを高速化する。大規模なビジョンおよび言語モデルの実験において、同期ベースラインと比較して最大2.0倍、最新の非同期手法と比較しても1.9倍速く精度に到達する。
Federated learning (FL) is typically performed in a synchronous parallel manner, where the involvement of a slow client delays a training iteration. Current FL systems employ a participant selection strategy to select fast clients with quality data in each iteration. However, this is not always possible in practice, and the selection strategy often has to navigate an unpleasant trade-off between the speed and the data quality of clients. In this paper, we present Pisces, an asynchronous FL system with intelligent participant selection and model aggregation for accelerated training. To avoid incurring excessive resource cost and stale training computation, Pisces uses a novel scoring mechanism to identify suitable clients to participate in a training iteration. It also adapts the pace of model aggregation to dynamically bound the progress gap between the selected clients and the server, with a provable convergence guarantee in a smooth non-convex setting. We have implemented Pisces in an open-source FL platform called Plato, and evaluated its performance in large-scale experiments with popular vision and language models. Pisces outperforms the state-of-the-art synchronous and asynchronous schemes, accelerating the time-to-accuracy by up to 2.0x and 1.9x, respectively.
研究の動機と目的
- 同期フェデレーテッドラーニングにおけるクライアントの速度とデータ品質の間の本質的トレードオフを解消し、学習効率を向上させること。
- 完全または無制限のクライアント参加を伴う従来の非同期FLシステムにおけるリソースの非効率性とスタティック計算の問題を克服すること。
- 参加者選択とモデルアグリゲーションを最適化するスケーラブルで効率的かつ収束保証付きの非同期FLフレームワークを設計すること。
- 動的でデータ品質に配慮したクライアント選択を可能にするとともに、収束性とモデル精度を維持するためのスタリネスの境界を設定すること。
提案手法
- 訓練損失(データ品質の代理指標として)とクラスタリングを組み合わせた新しいクライアントスコアリング機構を導入し、損傷または悪意のあるデータを持つアウトライヤクライアントを検出・除外する。
- 更新のスタリネスが大きいクライアントの参加を抑えるために、選択スコアにスタリネスペナルティ要因を組み込むことで、スタティック計算の影響を軽減する。
- 選択されたクライアントとサーバー間の進行差を制限するように、モデルアグリゲーションの速度を動的に調整し、滑らかな非凸設定での収束を保証する。
- クライアントの訓練進行を予測するモデルを用いてスタリネスを推定し、選択をガイドすることで、リアルタイム同期の依存度を低減する。
- オープンソースのPlato FLプラットフォームと統合し、多様なビジョンおよび言語モデルにおけるエンドツーエンドのデプロイと評価を可能にする。
- 同期および非同期プロトコルの両方をサポートする汎用的なFLフレームワークの抽象化を採用し、FL設計間の公平な比較を可能にする。
実験結果
リサーチクエスチョン
- RQ1非同期フェデレーテッドラーニングは、収束保証を維持しながら、同期手法よりも精度に到達するまでの時間を短縮できるか?
- RQ2遅延クライアントが存在する中で、データ品質とクライアント速度の両方を最適化するためのクライアント選択はどのように最適化できるか?
- RQ3学習効率を損なわずに、非同期FLにおけるスタリネスを効果的に制限するメカニズムは何か?
- RQ4統一されたフレームワークは、同期および非同期FLプロトコルの両方を一貫した性能評価でサポートできるか?
- RQ5データの損傷や悪意のあるラベルの反転が発生した場合、システムはどのように動作するか?また、アウトライヤクライアントを効果的に検出し排除できるか?
主な発見
- Piscesは、大規模な実験において、最新の同期FL方式と比較して、精度に到達するまでの時間を最大2.0倍まで短縮する。
- 既存の最良の非同期ベースラインと比較して、最大1.9倍の高速化を達成し、優れたスケーラビリティと効率性を示す。
- スタリーマーが低品質なデータを持つ状況下で、PiscesはOort(最新の選択戦略)を最大2.7倍の性能で上回る。
- アウーターディテクションを備えたPisces(Pisces w/ rob.)は、それ以外のバージョンよりも高い最終的な精度を達成しており、特に5%のラベル汚染下でそのロバストネスが顕著に示されている。
- スタリネスペナルティ要因($\beta$)は、さまざまなタスクで顕著な性能向上をもたらす——例えば、StackOverflowでは$\beta=0.2$が最適であり、FEMNISTでは$\beta=0.5$が最適である——これは異なるデータ分布に適応可能であることを示している。
- Piscesは滑らかな非凸設定でも収束保証を維持しており、実用的デプロイに向けた理論的保証を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。