Skip to main content
QUICK REVIEW

[论文解读] Collaborative Learning in the Jungle (Decentralized, Byzantine, Heterogeneous, Asynchronous and Nonconvex Learning)

El Mahdi El Mhamdi, Sadegh Farhadkhani|arXiv (Cornell University)|Aug 3, 2020
Privacy-Preserving Technologies in Data被引用 15
一句话总结

本文提出了一种拜占庭协同学习与一种新问题——平均一致(averaging agreement)之间的新颖等价关系,其中节点必须收敛到接近诚实节点初始向量平均值的向量。该工作提出了两种最优的异步算法:一种要求 $ n \geq 6f+1 $ 以实现渐近正确性,另一种在 $ n \geq 3f+1 $ 条件下实现最优拜占庭容错能力,从而在对抗性、异构性和异步条件下实现稳健、去中心化的非凸学习。

ABSTRACT

We study Byzantine collaborative learning, where $n$ nodes seek to collectively learn from each others' local data. The data distribution may vary from one node to another. No node is trusted, and $f < n$ nodes can behave arbitrarily. We prove that collaborative learning is equivalent to a new form of agreement, which we call averaging agreement. In this problem, nodes start each with an initial vector and seek to approximately agree on a common vector, which is close to the average of honest nodes' initial vectors. We present two asynchronous solutions to averaging agreement, each we prove optimal according to some dimension. The first, based on the minimum-diameter averaging, requires $ n \\geq 6f+1$, but achieves asymptotically the best-possible averaging constant up to a multiplicative constant. The second, based on reliable broadcast and coordinate-wise trimmed mean, achieves optimal Byzantine resilience, i.e., $n \\geq 3f+1$. Each of these algorithms induces an optimal Byzantine collaborative learning protocol. In particular, our equivalence yields new impossibility theorems on what any collaborative learning algorithm can achieve in adversarial and heterogeneous environments.

研究动机与目标

  • 在去中心化、拜占庭、异构、异步且非凸的环境中形式化协同学习。
  • 建立协同学习与一种新抽象问题——平均一致之间的等价关系。
  • 通过分析平均一致的根本极限,证明协同学习的不可能性定理。
  • 设计两种平均一致的最优算法,从而导出最优的拜占庭协同学习协议。
  • 通过在ResNet模型上实现,展示所提算法的实际可行性与性能开销。

提出的方法

  • 通过使用平均一致来聚合随机梯度并压缩模型以防止漂移,将协同学习归约为平均一致问题。
  • 在第一种算法中采用最小直径平均,要求 $ n \geq 6f+1 $,以实现渐近最优的平均常数。
  • 在第二种算法中使用可靠广播与逐坐标截断均值(RB-TM),在 $ n \geq 3f+1 $ 条件下实现最优拜占庭容错能力。
  • 通过界定诚实节点模型的直径并分析有效梯度,证明正确性。
  • 通过一种紧致的归约方式,将协同学习紧致地映射到平均一致问题,保留正确性保证,并支持不可能性结果的推导。
  • 在i.i.d.与非i.i.d.数据下,在3个ResNet模型上实现并评估算法,以测量吞吐量开销。

实验结果

研究问题

  • RQ1能否在完全去中心化、拜占庭、异构、异步且非凸的环境中正式定义并解决协同学习问题?
  • RQ2协同学习与一种新抽象——平均一致之间是否存在根本等价关系?
  • RQ3实现协同学习中拜占庭容错所需的最小系统条件(如 $ n \geq 3f+1 $)是什么?
  • RQ4在平均一致问题中,正确性与容错能力的根本极限(不可能性定理)是什么,进而对协同学习也成立?
  • RQ5在现实的非i.i.d.数据分布下,所提算法在性能开销方面如何比较?

主要发现

  • 第一种算法在乘法常数范围内实现了渐近最优的平均常数,要求 $ n \geq 6f+1 $,在i.i.d.设置下最多引入1.7倍的延迟,在非i.i.d.设置下接近3倍。
  • 第二种算法在 $ n \geq 3f+1 $ 条件下实现了最优拜占庭容错能力,引入的开销略高于一个数量级,非i.i.d.情况下的延迟是i.i.d.情况的两倍。
  • RB-TM算法实现了 $ \frac{4f}{\sqrt{h}} $-平均一致,其中 $ h $ 为诚实节点的数量,确保与真实平均值的偏差有界。
  • 已证明当 $ n \leq 3f $ 时,任何算法都无法实现拜占庭平均一致,从而确立了系统规模的根本下界。
  • 本文证明,在此对抗性环境中,任何协同学习协议都受到与平均一致问题推导出的相同不可能性结果的约束。
  • 协同学习与平均一致之间的等价关系,使得通过分析更简单的平均一致抽象,能够推导出最优协议与紧致的不可能性定理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。