Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Learning in the Jungle (Decentralized, Byzantine, Heterogeneous, Asynchronous and Nonconvex Learning)

El Mahdi El Mhamdi, Sadegh Farhadkhani|arXiv (Cornell University)|Aug 3, 2020
Privacy-Preserving Technologies in Data被引用数 15
ひとこと要約

本稿は、Byzantine協調学習と、誠実なノードの初期ベクトルの平均に近いベクトルに収束する必要があるという新しい問題である平均化合意(averaging agreement)との間で、新たな同等性を提示する。本稿では、非同期的に動作する最適なアルゴリズムを2つ提案しており、1つは漸近的正しさを達成するための $ n \geq 6f+1 $ を要し、もう1つは最適なByzantine耐性を達成するための $ n \geq 3f+1 $ を要する。これにより、攻撃的で、非均質的で、非同期的な条件下でも、頑健で分散型の非凸学習が可能になる。

ABSTRACT

We study Byzantine collaborative learning, where $n$ nodes seek to collectively learn from each others' local data. The data distribution may vary from one node to another. No node is trusted, and $f < n$ nodes can behave arbitrarily. We prove that collaborative learning is equivalent to a new form of agreement, which we call averaging agreement. In this problem, nodes start each with an initial vector and seek to approximately agree on a common vector, which is close to the average of honest nodes' initial vectors. We present two asynchronous solutions to averaging agreement, each we prove optimal according to some dimension. The first, based on the minimum-diameter averaging, requires $ n \\geq 6f+1$, but achieves asymptotically the best-possible averaging constant up to a multiplicative constant. The second, based on reliable broadcast and coordinate-wise trimmed mean, achieves optimal Byzantine resilience, i.e., $n \\geq 3f+1$. Each of these algorithms induces an optimal Byzantine collaborative learning protocol. In particular, our equivalence yields new impossibility theorems on what any collaborative learning algorithm can achieve in adversarial and heterogeneous environments.

研究の動機と目的

  • 分散型、Byzantine的、非均質的、非同期的、非凸的環境における協調学習の形式的定式化。
  • 協調学習と、新たに提唱された抽象的問題である平均化合意との間の同等性の確立。
  • 平均化合意の基本的限界を分析することで、協調学習における不可能性定理の確立。
  • 平均化合意のための2つの最適なアルゴリズムの設計。これにより、最適なByzantine協調学習プロトコルが導かれる。
  • 実装を通じて、提案されたアルゴリズムの実用的妥当性と性能オーバーヘッドを、ResNetモデルを用いて評価。

提案手法

  • 確率的勾配の集約とモデルの収縮を用いて、協調学習を平均化合意に還元し、ずれを防ぐ。
  • 最初のアルゴリズムでは、最小直径平均化を採用し、$ n \geq 6f+1 $ を要し、漸近的に最適な平均化定数を達成する。
  • 2番目のアルゴリズムでは、信頼性のあるブロードキャストと座標単位のトリムド平均(RB-TM)を用い、$ n \geq 3f+1 $ で最適なByzantine耐性を達成する。
  • 誠実なノードのモデルの直径をバウンディングし、有効な勾配を分析することで、正しさを証明する。
  • 協調学習から平均化合意へのタイトな還元を適用し、正しさの保証を保持するとともに、不可能性結果の導出を可能にする。
  • i.i.d. および非i.i.d. データの両方の条件下で、3つのResNetモデルを用いてアルゴリズムを実装・評価し、スループットのオーバーヘッドを測定する。

実験結果

リサーチクエスチョン

  • RQ1分散型、Byzantine的、非均質的、非同期的、非凸的環境において、協調学習を形式的に定義・解決可能か?
  • RQ2協調学習と、新たに提唱された抽象概念である平均化合意との間に、根本的な同等性が存在するか?
  • RQ3協調学習におけるByzantine耐性を達成するために必要な最小のシステム条件(例:$ n \geq 3f+1 $)は何か?
  • RQ4平均化合意(およびそれにより導かれる協調学習)における正しさと耐性の根本的限界(不可能性定理)は何か?
  • RQ5実際の非i.i.i.d. データ分布下で、提案されたアルゴリズムの性能オーバーヘッドは、どのように比較されるか?

主な発見

  • 最初のアルゴリズムは、乗法的定数の範囲で漸近的に最適な平均化定数を達成し、$ n \geq 6f+1 $ を要する。i.i.d. 環境では最大1.7倍の遅延、非i.i.d. 環境ではほぼ3倍の遅延が生じる。
  • 2番目のアルゴリズムは、$ n \geq 3f+1 $ で最適なByzantine耐性を達成し、わずかに10倍を超えるオーバーヘッドを追加する。非i.i.d. 環境の遅延はi.i.d. 環境の2倍にのぼる。
  • RB-TMアルゴリズムは、$ \frac{4f}{\sqrt{h}} $-平均化合意を達成する。ここで $ h $ は誠実なノードの数であり、真の平均からのずれが有界であることを保証する。
  • すべてのアルゴリズムが $ n \leq 3f $ の場合にByzantine平均化合意を達成できないことが証明され、システムサイズの根本的下限が確立される。
  • 本稿では、この攻撃的環境下での任意の協調学習プロトコルが、平均化合意問題から導かれる同じ不可能性定理によって制約されることを確立する。
  • 協調学習と平均化合意との同等性により、より単純な平均化合意の抽象化の分析を通じて、最適プロトコルとタイトな不可能性定理の導出が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。