Skip to main content
QUICK REVIEW

[论文解读] Anarchic Federated Learning

Haibo Yang, Xin Zhang|arXiv (Cornell University)|Aug 23, 2021
Privacy-Preserving Technologies in Data参考文献 39被引用 6
一句话总结

本文提出了一种新型联邦学习范式——无政府联邦学习(AFL),其中参与方自主选择参与时机和本地更新步数,实现在异构边缘环境中的灵活、去中心化训练。该工作提出了两种收敛算法 AFA-CD 与 AFA-CS,在温和的无政府假设下实现了最优收敛速率与线性加速,尽管存在参与方异步与动态计算,其性能仍达到当前最先进水平。

ABSTRACT

Present-day federated learning (FL) systems deployed over edge networks consists of a large number of workers with high degrees of heterogeneity in data and/or computing capabilities, which call for flexible worker participation in terms of timing, effort, data heterogeneity, etc. To satisfy the need for flexible worker participation, we consider a new FL paradigm called "Anarchic Federated Learning" (AFL) in this paper. In stark contrast to conventional FL models, each worker in AFL has the freedom to choose i) when to participate in FL, and ii) the number of local steps to perform in each round based on its current situation (e.g., battery level, communication channels, privacy concerns). However, such chaotic worker behaviors in AFL impose many new open questions in algorithm design. In particular, it remains unclear whether one could develop convergent AFL training algorithms, and if yes, under what conditions and how fast the achievable convergence speed is. Toward this end, we propose two Anarchic Federated Averaging (AFA) algorithms with two-sided learning rates for both cross-device and cross-silo settings, which are named AFA-CD and AFA-CS, respectively. Somewhat surprisingly, we show that, under mild anarchic assumptions, both AFL algorithms achieve the best known convergence rate as the state-of-the-art algorithms for conventional FL. Moreover, they retain the highly desirable {\em linear speedup effect} with respect of both the number of workers and local steps in the new AFL paradigm. We validate the proposed algorithms with extensive experiments on real-world datasets.

研究动机与目标

  • 为解决以服务器为中心的联邦学习所存在的局限性,后者依赖于同步、协调的参与方参与模式,且协调开销较高。
  • 在参与方能力异构、可用性动态变化、资源约束各异的边缘网络中,实现灵活、去中心化的训练。
  • 在参与方行为无政府化(即参与时机与本地步数由参与方自主控制且异步)的条件下,设计收敛的联邦学习算法。
  • 在无政府条件下,仍保持与参与方数量及本地步数呈线性关系的线性加速优势。
  • 在非独立同分布(non-i.i.d.)数据与动态参与方行为下,通过真实世界数据集验证所提算法的有效性。

提出的方法

  • 在跨设备(AFA-CD)与跨孤岛(AFA-CS)设置下,提出无政府联邦平均(AFA),采用双侧学习率以处理异步参与方更新。
  • 设计一种服务器端聚合规则,根据参与方参与频率与本地步数动态加权接收的模型更新,确保在参与方行为时变条件下的收敛性。
  • 提出一种新型收敛性分析框架,考虑异步、非均匀参与方参与与可变本地步数,证明在温和无政府假设下的收敛性。
  • 采用双侧学习率:一者用于参与方本地更新,另一者用于服务器端模型平均,从而增强对参与方异构性与异步性的鲁棒性。
  • 通过在 AFA 框架中最小修改地集成 FedProx 与 SCAFFOLD 等现有联邦学习优化器,使其适用于 AFL。
  • 采用均匀采样与有偏采样策略,模拟多样的参与方到达过程,评估对数据与参与偏置的鲁棒性。

实验结果

研究问题

  • RQ1当参与方独立选择参与时机与本地更新步数时,能否在联邦学习中实现收敛训练?
  • RQ2所提算法在何种条件下保持收敛?在无政府设置下,可实现的收敛速率是多少?
  • RQ3无政府联邦学习范式是否仍能保持与参与方数量及本地步数相关的线性加速效应?
  • RQ4在动态与异步参与方行为下,使用 FedProx 与 SCAFFOLD 等先进优化器时,AFL 的性能与传统联邦学习相比如何?
  • RQ5有偏的参与方到达过程与延迟梯度对 AFL 中模型收敛性与准确性有何影响?

主要发现

  • 所提 AFA-CD 与 AFA-CS 算法在温和无政府假设下,对非凸问题实现了最优收敛速率 O(1/T),与当前最先进以服务器为中心的联邦学习算法持平。
  • AFA-CD 与 AFA-CS 均保持线性加速效应:收敛时间随参与方数量与本地步数的增加而线性减少,即使在异步与动态参与方参与条件下亦成立。
  • 实验结果表明,将 FedProx 集成至 AFL 后,性能与 FedAvg 相当,且在 MNIST 与 CIFAR-10 上不同非独立同分布水平下均无准确率下降。
  • 基于 SCAFFOLD 的 AFL 在高非独立同分布水平(p=1)的卷积神经网络上表现出性能下降,可能归因于部分参与时控制变量的延迟,但低非独立同分布设置下性能保持稳定。
  • 参与方到达过程中的有偏采样在高度非独立同分布数据(p=1)上导致性能下降,但采用方差缩减的 AFA-CS 变体在 MNIST 上保持强性能,在 CIFAR-10 上实现中等性能,表明具备部分鲁棒性。
  • 实验结果证实,AFL 集成 FedProx 与 SCAFFOLD 在多种设置下(包括 Shakespeare 与 CIFAR-10 等真实数据集)均保持高测试准确率,即使在异步与动态本地步数条件下亦成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。