Skip to main content
QUICK REVIEW

[論文レビュー] Byzantine Resilient Non-Convex SVRG with Distributed Batch Gradient Computations

Prashant Khanduri, Saikiran Bulusu|arXiv (Cornell University)|Dec 10, 2019
Stochastic Gradient Optimization Techniques参考文献 19被引用数 10
ひとこと要約

本稿は、分散型バッチ勾配計算を伴うベーシルトレジリエント非凸SVRGアルゴリズムを提案する。ワーカーノードはバッチ勾配を計算し、サーバーノードは確率的勾配を計算する。$ ilde{O}\left(\frac{1}{\epsilon^{5/3}K^{2/3}} + \frac{\alpha^{4/3}}{\epsilon^{5/3}}\right)$ の期待勾配計算複雑度を達成し、$ε$-停留点に到達する。これは、最大$α$-分数のベーシルトノードが存在する状況において、先行研究のレートを改善する。

ABSTRACT

In this work, we consider the distributed stochastic optimization problem of minimizing a non-convex function $f(x) = \mathbb{E}_{ξ\sim \mathcal{D}} f(x; ξ)$ in an adversarial setting, where the individual functions $f(x; ξ)$ can also be potentially non-convex. We assume that at most $α$-fraction of a total of $K$ nodes can be Byzantines. We propose a robust stochastic variance-reduced gradient (SVRG) like algorithm for the problem, where the batch gradients are computed at the worker nodes (WNs) and the stochastic gradients are computed at the server node (SN). For the non-convex optimization problem, we show that we need $ ilde{O}\left( \frac{1}{ε^{5/3} K^{2/3}} + \frac{α^{4/3}}{ε^{5/3}} ight)$ gradient computations on average at each node (SN and WNs) to reach an $ε$-stationary point. The proposed algorithm guarantees convergence via the design of a novel Byzantine filtering rule which is independent of the problem dimension. Importantly, we capture the effect of the fraction of Byzantine nodes $α$ present in the network on the convergence performance of the algorithm.

研究の動機と目的

  • 分散非凸最適化において、最大$\alpha$-分数のノードがベーシルトであるという悪意のある条件下での問題に対処すること。
  • 非凸設定下でベーシルトノードの挙動に対しても収束保証を維持できるロバストなアルゴリズムを設計すること。
  • ワーカーノードにバッチ勾配計算をオフロードすることで、サーバーの計算負荷を軽減すること。
  • 次元に依存しないベーシルトフィルタリングルールを設計し、座標単位の操作を避けて収束を保証すること。
  • ベーシルト攻撃下における分散非凸最適化のための最先端の収束レートを改善すること。

提案手法

  • アルゴリズムは、ワーカーノード(WN)がバッチ勾配$\mu_t^{(k)}$を計算し、サーバーノード(SN)が確率的勾配を計算するSVRGの変種を使用する。
  • 新規のベーシルトフィルタリングルールにより、ペアワイズ距離のしきい値$\mathfrak{T}_\mu$および$\mathcal{V}$に基づいて中央値勾配推定$\mu_t^{\text{med}}$が選択され、非ベーシルトノードの信頼性の高い集合$\mathcal{G}_t$が形成される。
  • 初期集合$\mathcal{G}_t$のノード数が$(1 - \alpha)K$未満の場合、集合を拡張するために緩いしきい値$2\mathcal{V}$が使用され、$|\mathcal{G}_t| \geq (1 - \alpha)K$が保証される。
  • サーバーは$\mu_t = \frac{1}{|\mathcal{G}_t|} \sum_{k \in \mathcal{G}_t} \mu_t^{(k)}$を用いて勾配を集約し、真の勾配のロバスト推定を形成する。
  • 内部ループの反復回数$N_t \sim \text{Geom}(B / (B + 1))$が、分散還元された確率的更新$x_n^t = x_{n-1}^t - \eta_t v_{n-1}^t$の計算に使用され、$v_{n-1}^t = \nabla f(x_{n-1}^t; \xi_{n-1}^t) - \nabla f(x_0^t; \xi_{n-1}^t) + \mu_t$となる。
  • 最終出力$\tilde{x}_a$は、反復列$\{\tilde{x}_t\}_{t=1}^T$から一様にランダムに抽出されたものである。

実験結果

リサーチクエスチョン

  • RQ1分散最適化における非凸SVRGベースのアルゴリズムは、ベーシルトノードに対してレジリエントにできるか?
  • RQ2ベーシルトノードの割合$\alpha$は、分散非凸最適化の収束レートにどのように影響するか?
  • RQ3次元$d$に依存しないベーシルトフィルタリングルールを設計できるか?
  • RQ4ワーカーノードにバッチ勾配計算をオフロードすることで、収束効率が向上し、ロバスト性を維持できるか?
  • RQ5ベーシルトノードが存在する状況で、既存手法と比較して収束レートを改善できるか?

主な発見

  • アルゴリズムは、各ノードで$ε$-停留点に到達するための期待勾配計算複雑度$\tilde{O}\left(\frac{1}{\epsilon^{5/3}K^{2/3}} + \frac{\alpha^{4/3}}{\epsilon^{5/3}}\right)$を達成する。
  • $\alpha = 0$のとき、複雑度は$O\left(\frac{1}{\epsilon^{5/3}K^{2/3}}\right)$に簡略化され、分散非凸最適化における既存の最良レート$O\left(\frac{1}{\epsilon^2 K}\right)$を上回る。
  • 提案されたベーシルトフィルタリングルールは次元に依存せず、座標単位の操作を回避するため、高次元問題に適している。
  • アルゴリズムは、ノードの最大$\alpha < \frac{1}{2}$がベーシルトであっても収束を維持し、収束レートが明示的に$\alpha$に依存することが示された。
  • 理論的分析により、分散還元機構とロバスト集約の組み合わせが、非凸目的関数下でも収束を保証することが分かった。
  • サーバーでのみ実行された場合、アルゴリズムは$O\left(\frac{1}{\epsilon^{5/3}}\right)$の最良-knownレートと一致し、単一ノード非凸SVRGと整合性があることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。