Skip to main content
QUICK REVIEW

[论文解读] FedNL: Making Newton-Type Methods Applicable to Federated Learning

Mher Safaryan, Rustem Islamov|arXiv (Cornell University)|Jun 5, 2021
Privacy-Preserving Technologies in Data参考文献 34被引用 12
一句话总结

本文提出 FedNL,一种新型联邦牛顿型优化方法家族,可在联邦设置中实现高效、隐私保护的二阶学习。通过将海森矩阵学习与原始数据解耦,并利用压缩性压缩技术(如 Top-K、Rank-R),FedNL 实现了与条件数、数据规模和压缩方差无关的本地收敛性——实验表明其在通信效率方面达到当前最先进水平。

ABSTRACT

Inspired by recent work of Islamov et al (2021), we propose a family of Federated Newton Learn (FedNL) methods, which we believe is a marked step in the direction of making second-order methods applicable to FL. In contrast to the aforementioned work, FedNL employs a different Hessian learning technique which i) enhances privacy as it does not rely on the training data to be revealed to the coordinating server, ii) makes it applicable beyond generalized linear models, and iii) provably works with general contractive compression operators for compressing the local Hessians, such as Top-$K$ or Rank-$R$, which are vastly superior in practice. Notably, we do not need to rely on error feedback for our methods to work with contractive compressors. Moreover, we develop FedNL-PP, FedNL-CR and FedNL-LS, which are variants of FedNL that support partial participation, and globalization via cubic regularization and line search, respectively, and FedNL-BC, which is a variant that can further benefit from bidirectional compression of gradients and models, i.e., smart uplink gradient and smart downlink model compression. We prove local convergence rates that are independent of the condition number, the number of training data points, and compression variance. Our communication efficient Hessian learning technique provably learns the Hessian at the optimum. Finally, we perform a variety of numerical experiments that show that our FedNL methods have state-of-the-art communication complexity when compared to key baselines.

研究动机与目标

  • 为解决联邦学习中缺乏可扩展、隐私保护的二阶方法的问题。
  • 克服先前牛顿学习框架的局限性,这些框架需要披露数据且对通用压缩技术缺乏鲁棒性。
  • 开发一种不依赖服务器训练数据的通信高效海森矩阵学习机制。
  • 在不使用误差反馈的前提下,确保在通用压缩性压缩下的收敛鲁棒性。
  • 将 FedNL 扩展至部分参与、全局化(线搜索、立方正则化)以及双向压缩机制,以支持实际部署。

提出的方法

  • 提出一种新型海森矩阵学习技术,通过压缩的局部海森矩阵差异估计全局海森矩阵,避免将训练数据直接暴露给服务器。
  • 在局部海森矩阵上应用压缩性压缩算子(如 Top-K、Rank-R),并证明其收敛性,即使在无误差反馈的情况下亦成立。
  • 引入多种变体:FedNL-PP(部分参与)、FedNL-LS(线搜索全局化)、FedNL-CR(立方正则化)以及 FedNL-BC(双向压缩)。
  • 采用两阶段更新机制:首先通过压缩差异进行局部海森矩阵校正,随后使用学习率 α 更新全局海森矩阵。
  • 提出一种新颖的海森矩阵校正机制,可补偿梯度与海森矩阵更新中的压缩误差。
  • 采用数据无关的海森矩阵学习策略,使其不仅适用于广义线性模型,还可扩展至更广泛场景。

实验结果

研究问题

  • RQ1能否在不向服务器暴露训练数据的前提下,使二阶方法在联邦学习中具备实用性?
  • RQ2在无误差反馈的情况下,Top-K 或 Rank-R 等压缩性压缩算子能否在联邦牛顿方法的海森矩阵更新中有效应用?
  • RQ3所提出的海森矩阵学习技术是否能在不依赖条件数、数据规模和压缩方差的前提下实现收敛?
  • RQ4FedNL 变体是否能在保持收敛性的前提下,支持部分参与、全局化与双向压缩?
  • RQ5在通信效率与收敛速度方面,FedNL 相较于现有基线方法表现如何?

主要发现

  • FedNL 实现了与条件数、数据点数量及压缩方差无关的本地收敛速率。
  • 所提出的海森矩阵学习技术可严格证明在无需访问原始训练数据的前提下学习到最优解处的海森矩阵。
  • FedNL-BC 通过实现智能上行链路梯度压缩与下行链路模型压缩,显著提升了通信效率。
  • 数值实验表明,FedNL 在多种设置下均优于关键基线方法,在通信复杂度方面表现更优。
  • 该方法在不使用误差反馈的前提下,仍能保持对通用压缩性压缩器(如 Top-K、Rank-R)的收敛性。
  • FedNL-LS 与 FedNL-CR 分别通过线搜索与立方正则化成功实现了全局收敛,且在相同假设条件下表现稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。