Skip to main content
QUICK REVIEW

[論文レビュー] Byzantine-Resilient Stochastic Gradient Descent for Distributed Learning: A Lipschitz-Inspired Coordinate-wise Median Approach

Haibo Yang, Xin Zhang|arXiv (Cornell University)|Sep 10, 2019
Stochastic Gradient Optimization Techniques参考文献 11被引用数 9
ひとこと要約

本稿では、悪意ある勾配をフィルタリングするためにリプシッツにインspiredされた座標単位の中央値を用いる、Byzantine耐性のある確率的勾配降下法であるLICM-SGDを提案する。本手法は、攻撃者数の事前知識を必要とせず、最大50%のByzantineワーカーに対しても収束を達成し、最適なO(md)の計算複雑度を維持しながら、MNISTおよびCIFAR-10データセットにおいて、既存手法を上回る精度と効率性を達成する。

ABSTRACT

In this work, we consider the resilience of distributed algorithms based on stochastic gradient descent (SGD) in distributed learning with potentially Byzantine attackers, who could send arbitrary information to the parameter server to disrupt the training process. Toward this end, we propose a new Lipschitz-inspired coordinate-wise median approach (LICM-SGD) to mitigate Byzantine attacks. We show that our LICM-SGD algorithm can resist up to half of the workers being Byzantine attackers, while still converging almost surely to a stationary region in non-convex settings. Also, our LICM-SGD method does not require any information about the number of attackers and the Lipschitz constant, which makes it attractive for practical implementations. Moreover, our LICM-SGD method enjoys the optimal $O(md)$ computational time-complexity in the sense that the time-complexity is the same as that of the standard SGD under no attacks. We conduct extensive experiments to show that our LICM-SGD algorithm consistently outperforms existing methods in training multi-class logistic regression and convolutional neural networks with MNIST and CIFAR-10 datasets. In our experiments, LICM-SGD also achieves a much faster running time thanks to its low computational time-complexity.

研究の動機と目的

  • 分散SGDがByzantine攻撃に対して脆弱であるという問題に取り組む。この攻撃では、悪意あるワーカーが学習を妨害するために任意の勾配を送信する。
  • 攻撃者数やリプシッツ定数の事前知識を必要としない、耐性の高い集約手法を開発すること。
  • 標準SGDと同等の低い計算複雑度を達成しながら、悪意ある勾配に対して強い耐性を維持すること。
  • 非凸設定において、高頻度のByzantine影響下でも定常領域への収束を保証する手法を設計すること。
  • 複数のディープラーニングタスクにおいて、分類精度と実行時間効率の両面で、本手法の優位性を実証的に検証すること。

提案手法

  • 本手法は、健全なワーカーの勾配が持つ滑らかさの性質を活用した、リプシッツにインspiredされた座標単位の中央値フィルタリング機構を導入する。
  • 各勾配の座標ごとに、すべてのワーカーの更新値の中央値を計算することで、Byzantine攻撃によって生じる外れ値を効果的に抑制する。
  • 健全な勾配はリプシッツ境界内に位置するのに対し、悪意ある勾配は大きさや方向で著しく逸脱することが多いという事実を活用する。
  • 座標単位の中央値は、各パラメータ次元ごとに独立して計算されるため、任意の方向の攻撃に対しても耐性を発揮する。
  • 計算効率が高く、1イテレーションあたりO(md)の時間計算量を有し、標準SGDと同等の複雑度である。
  • 攻撃者数やリプシッツ定数に関連するハイパーパrameterは一切不要であり、実用的な展開性が向上する。

実験結果

リサーチクエスチョン

  • RQ1攻撃者数の知識を必要としない座標単位の中央値ベースの集約手法は、Byzantine耐性を達成できるか?
  • RQ2最大半数のワーカーがByzantineである状況下でも、非凸設定において定常領域への収束を維持できるか?
  • RQ3提案されたリプシッツにインspiredされたフィルタリング機構は、実際の状況で健全な勾配と悪意ある勾配を効果的に区別できるか?
  • RQ4標準SGDと同等の計算複雑度を達成しながら、耐性を確保できるか?
  • RQ5最先端のByzantine耐性ありアルゴリズムと比較して、分類精度と学習安定性の面で本手法は優れているか?

主な発見

  • Omniscient攻撃下で、MNISTのCNNにおいて、40人のワーカーのうち18人がByzantineである状況でも、LICM-SGDは85%のテスト精度を達成し、攻撃なしのベースラインからわずか2.5%低下にとどまる。
  • 攻撃者数が0から18に増加しても、精度は87.5%から83.2%に低下するにとどまり、ほぼベースライン性能を維持する。
  • LICM-SGDは、MNISTおよびCIFAR-10における複数の実験で、Krum、Bulyan、Median、Trimmed Meanをすべて上回る精度と安定性を達成する。
  • 最適なO(md)の計算複雑度を達成しており、既存の高耐性手法のO(m²d)と比較して顕著に低い。
  • LICM-SGDは、データサンプルや攻撃者設定の変動に対して感受性が低く、異なる実行間で一貫した性能を示す。
  • 攻撃者数やリプシッツ定数の事前知識を必要としないため、実世界の展開において実用性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。