Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Optimization over Block-Cyclic Data

Yucheng Ding, Chaoyue Niu|arXiv (Cornell University)|Feb 18, 2020
Privacy-Preserving Technologies in Data参考文献 19被引用数 8
ひとこと要約

本稿では、ブロックサイクル的で非i.i.d.かつアンバランスなデータを想定したフェデレーテッドラーニングにおける分散最適化アルゴリズムMM-PSGDとMC-PSGDを提案する。ブロック混合およびブロック別戦略を用いてブロック固有の予測器を訓練することで、両手法とも収束速度 $O(1/\sqrt{NT})$ を達成し、MC-PSGDはさらに各ブロックの最適モデルへの収束を保証する。CIFAR-10では、FedAvgより最大6%高いテスト精度を達成する。

ABSTRACT

We consider practical data characteristics underlying federated learning, where unbalanced and non-i.i.d. data from clients have a block-cyclic structure: each cycle contains several blocks, and each client's training data follow block-specific and non-i.i.d. distributions. Such a data structure would introduce client and block biases during the collaborative training: the single global model would be biased towards the client or block specific data. To overcome the biases, we propose two new distributed optimization algorithms called multi-model parallel SGD (MM-PSGD) and multi-chain parallel SGD (MC-PSGD) with a convergence rate of $O(1/\sqrt{NT})$, achieving a linear speedup with respect to the total number of clients. In particular, MM-PSGD adopts the block-mixed training strategy, while MC-PSGD further adds the block-separate training strategy. Both algorithms create a specific predictor for each block by averaging and comparing the historical global models generated in this block from different cycles. We extensively evaluate our algorithms over the CIFAR-10 dataset. Evaluation results demonstrate that our algorithms significantly outperform the conventional federated averaging algorithm in terms of test accuracy, and also preserve robustness for the variance of critical parameters.

研究の動機と目的

  • アンバランスで非i.i.d.かつブロックサイクル的データ分布に起因するクライアントおよびブロックバイアスを解消すること。
  • 実用的なFLのデータ特性下でも収束保証を維持する分散最適化アルゴリズムの開発。
  • グローバルモデルに依存せず、ブロック固有の予測器を構築することで、テスト精度とロバスト性の向上。
  • クライアント参加率、ブロック数、ローカルイテレーション数の変動に対する提案手法の性能評価。

提案手法

  • MM-PSGDはブロック混合トレーニング戦略を用い、各トレーニングラウンドで複数のブロックを順次処理し、サイクル間で同じブロックからの歴史的グローバルモデルの平均値を用いてブロック固有の予測器を構築する。
  • MC-PSGDはMM-PSGDを拡張し、ブロック別トレーニング戦略を採用。トレーニング中に各ブロックのデータのみを用いて、各ブロックごとに独立したグローバルモデルを維持する。
  • 各ラウンドで、ブロック混合およびブロック別トレーニングプロセスからより高い性能を示すブロック固有の予測器を選択することで収束を改善する。
  • 両手法とも、最適グローバルモデルへの収束速度が $O(1/\sqrt{NT})$ であることを保証する。MC-PSGDはブロック固有モデルについて $O(\sqrt{M}/\sqrt{NT})$ の収束速度を達成する。
  • クライアント間でのモデルアveragingを実施し、サーバーでのローカル更新の集約により通信効率を維持する。
  • ブロックサイクル的データ構造は、複数のサイクルからなり、各サイクルに異なる非i.i.d.分布を持つ複数のデータブロックを含む。

実験結果

リサーチクエスチョン

  • RQ1ブロックサイクル的で非i.i.d.なデータ下で、従来のフェデレーテッドアverージングはクライアントおよびブロックバイアスの影響をどのように受けるか?
  • RQ2アンバランスで非i.i.d.かつブロックサイクル的データを有するフェデレーテッドラーニングにおいて、ブロック固有の予測器は収束性とテスト精度をどのように向上させるか?
  • RQ3ブロック混合およびブロック別トレーニング戦略を組み合わせることで、単一モデルアプローチに比べて収束速度と一般化性能が向上するか?
  • RQ4ローカルイテレーション数やブロック数の変動が、提案手法の収束速度および最終的な精度に与える影響は何か?
  • RQ5クロスデバイスフェデレーテッドラーニング環境下で、低クライアント参加率に対しても提案手法はどれほどロバストか?

主な発見

  • MM-PSGDおよびMC-PSGDはCIFAR-10で65%のテスト精度を達成し、ブロックサイクル的データ下でFedAvgは56%〜59%の間を振動し収束しないことと比べ顕著に優れている。
  • シャッフル済みデータを用いたFedAvgは62%のテスト精度を示し、提案手法より3%低い。これはブロック固有モデリングの優位性を裏付ける。
  • 20回のローカルイテレーション条件下で、MC-PSGDは1,410ラウンドで60%の精度に到達するが、MM-PSGDは同じ条件下で1,610ラウンドを要する。
  • ブロック数 $M$ が2から10に増加するに従い、MM-PSGDのテスト精度は63%から67%に向上するが、MC-PSGDは64%〜65%の安定した性能を維持する。
  • 両手法とも低クライアント参加率に対してもロバストである。MC-PSGDは5%の参加率でも61%〜62%のテスト精度を達成し、参加率が20%に上昇しても性能は安定している。
  • 初期ラウンドにおける階段状の精度上昇は、特にMM-PSGDにおいて、最初の数サイクルでブロック固有の予測器が顕著に改善されていることを確認する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。