Skip to main content
QUICK REVIEW

[論文レビュー] Federated Variance-Reduced Stochastic Gradient Descent with Robustness to Byzantine Attacks

Zhaoxian Wu, Qing Ling|arXiv (Cornell University)|Dec 29, 2019
Stochastic Gradient Optimization Techniques参考文献 36被引用数 15
ひとこと要約

この論文は、SAGAによる分散型の分散低減と幾何学的中央値集約を組み合わせることで、悪意ある勾配攻撃に対して耐性を持つByzantine耐性の強いフェデレーテッドラーニングアルゴリズムであるByrd-SAGAを提案する。確率的勾配のノイズを低減することで、悪意ある更新と自然な勾配のゆらぎの区別が向上し、最適解の近傍への線形収束を達成する。その誤差は、Byzantineワーカーの数にのみ依存する。

ABSTRACT

This paper deals with distributed finite-sum optimization for learning over networks in the presence of malicious Byzantine attacks. To cope with such attacks, most resilient approaches so far combine stochastic gradient descent (SGD) with different robust aggregation rules. However, the sizeable SGD-induced stochastic gradient noise makes it challenging to distinguish malicious messages sent by the Byzantine attackers from noisy stochastic gradients sent by the 'honest' workers. This motivates us to reduce the variance of stochastic gradients as a means of robustifying SGD in the presence of Byzantine attacks. To this end, the present work puts forth a Byzantine attack resilient distributed (Byrd-) SAGA approach for learning tasks involving finite-sum optimization over networks. Rather than the mean employed by distributed SAGA, the novel Byrd- SAGA relies on the geometric median to aggregate the corrected stochastic gradients sent by the workers. When less than half of the workers are Byzantine attackers, the robustness of geometric median to outliers enables Byrd-SAGA to attain provably linear convergence to a neighborhood of the optimal solution, with the asymptotic learning error determined by the number of Byzantine workers. Numerical tests corroborate the robustness to various Byzantine attacks, as well as the merits of Byrd- SAGA over Byzantine attack resilient distributed SGD.

研究の動機と目的

  • フェデレーテッドラーニングにおけるByzantine攻撃下で、悪意ある勾配と高分散の確率的勾配を区別する課題に対処すること。
  • 確率的勾配のノイズを低減することで、分散最適化におけるByzantine更新の検出可能性を向上させること。
  • 半数未満のワーカーが損なわれても収束を維持できる耐性のある集約メカニズムを開発すること。
  • 最適解の安定した近傍への線形収束を達成し、漸近的誤差がByzantineワーカーの数にのみ依存すること。
  • 凸および非凸設定の両方において、標準的なByzantine耐性SGDおよびミニバッチSGDと比較して、優れた耐性と効率性を示すこと。

提案手法

  • 分散型有限和最適化に適応したSAGAアルゴリズムを用い、各ワーカーごとの勾配補正による分散低減を実現する。
  • 標準的なSAGAにおける平均集約を幾何的中央値集約に置き換えることで、外れ値に対する耐性を向上させる。
  • マスターノードがワーカーから補正済みの確率的勾配を収集し、それらの幾何的中央値を計算してモデル更新を行う。
  • 各ワーカーが過去の勾配をローカルメモリに保持し、SAGA更新則を用いて補正勾配を計算することを保証する。
  • 幾何的中央値の外れ値に対する耐性を活用し、大きな値や敵対的に設計されたメッセージですら抑制できることを活かす。
  • 半数未満のワーカーがByzantineであると仮定したもとで、最適解の近傍への線形収束を証明する。

実験結果

リサーチクエスチョン

  • RQ1確率的勾配の分散低減は、フェデレーテッドラーニングにおけるByzantine攻撃の検出可能性を向上させるか?
  • RQ2SAGAにおける平均集約を幾何的中央値に置き換えることで、Byzantine敵対者に対する耐性が向上するか?
  • RQ3Byzantine攻撃下において、分散低減と耐性のある集約が施されたフェデレーテッドラーニングアルゴリズムの漸近的収束挙動はいかなるものか?
  • RQ4このようなシステムにおいて、学習誤差はByzantineワーカーの数にどのように依存するか?
  • RQ5提案手法は、攻撃タイプにかかわらず、標準的なByzantine耐性SGDよりも収束性と耐性性に優れているか?

主な発見

  • Byrd-SAGAは、最適解の近傍への線形収束を達成し、漸近的学習誤差はByzantineワーカーの数にのみ依存する。
  • すべての誠実なワーカーが全データセットにアクセス可能な場合(すなわちδ² = 0)、Byrd-SAGAの漸近的誤差は消滅するが、Byzantine耐性SGDやBSGDとは異なり、そうならない。
  • IJCNN1データセットを用いた実験では、幾何的中央値集約を用いたByrd-SAGAが、ガウス分布、符号反転、ゼロ勾配攻撃のすべてにおいてSGDおよびBSGDを上回った。
  • 符号反転およびゼロ勾配攻撃の下では、Krum集約を用いたByrd-SAGAが最良の性能を示したが、幾何的中央値集約も強く耐性を示した。
  • MNISTデータセットでは、ゼロ勾配攻撃下で幾何的中央値集約を用いたByrd-SAGAは92.4%の精度を達成し、平均集約を用いたSGD(26.2%)およびBSGD(81.5%)を著しく上回った。
  • Byzantine耐性のあるBSGDよりも、1反復あたりの計算コストが低く抑えられつつ、優れた耐性と収束安定性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。