Skip to main content
QUICK REVIEW

[论文解读] Cross-Silo Federated Learning for Multi-Tier Networks with Vertical and Horizontal Data Partitioning

Anirban Das, Timothy Castiglia|arXiv (Cornell University)|Aug 19, 2021
Privacy-Preserving Technologies in Data参考文献 35被引用 4
一句话总结

本文提出分层去中心化坐标下降(TDCD),一种适用于具有垂直和水平数据划分的多层级网络的通信高效联邦学习算法。每个机柜内的客户端在与其中心节点通信前执行多次本地更新,中心节点之间交换中间更新,从而在减少通信开销的同时实现收敛,并具备收敛速率对本地步数和垂直划分依赖性的理论保证。

ABSTRACT

We consider federated learning in tiered communication networks. Our network model consists of a set of silos, each holding a vertical partition of the data. Each silo contains a hub and a set of clients, with the silo's vertical data shard partitioned horizontally across its clients. We propose Tiered Decentralized Coordinate Descent (TDCD), a communication-efficient decentralized training algorithm for such two-tiered networks. The clients in each silo perform multiple local gradient steps before sharing updates with their hub to reduce communication overhead. Each hub adjusts its coordinates by averaging its workers' updates, and then hubs exchange intermediate updates with one another. We present a theoretical analysis of our algorithm and show the dependence of the convergence rate on the number of vertical partitions and the number of local updates. We further validate our approach empirically via simulation-based experiments using a variety of datasets and objectives.

研究动机与目标

  • 解决在数据在各机柜间垂直划分、机柜内部水平划分的多层级网络中训练全局模型的挑战。
  • 通过在跨机柜通信前允许多次本地更新,降低联邦学习中的通信开销。
  • 设计一种去中心化训练算法,在复杂的数据划分和通信约束下保持收敛性保证。
  • 从理论上分析所提算法的收敛速率,考虑垂直划分数量和本地更新步数的影响。
  • 通过在多种数据集和目标上的模拟实验,对方法进行经验验证。

提出的方法

  • TDCD 在两级网络架构中运行:每个机柜内的客户端在更新其所属中心节点前执行多次本地梯度更新。
  • 每个中心节点通过坐标平均法聚合其客户端的更新,以保持模型一致性。
  • 中心节点之间交换中间模型更新,以实现跨机柜的进度同步。
  • 该算法采用去中心化坐标下降框架,每个机柜仅优化其模型坐标子集。
  • 理论分析界定了收敛速率,表明其对垂直划分数量和本地更新步数的依赖性。
  • 关键技术贡献在于推导出在有界梯度和噪声下的非凸优化问题的收敛边界。

实验结果

研究问题

  • RQ1如何在具有垂直和水平数据划分的多层级网络中高效扩展联邦学习?
  • RQ2在垂直联邦学习中,多次本地更新对收敛性和通信效率有何影响?
  • RQ3垂直划分数量(即机柜数量)如何影响全局模型的收敛速率?
  • RQ4去中心化、通信高效的算法能否在如此复杂的网络和数据结构中保持收敛性保证?
  • RQ5在此场景下,本地计算与通信频率之间的权衡关系是什么?

主要发现

  • TDCD 实现了收敛,理论边界表明收敛速率依赖于垂直划分数量和每轮通信的本地更新次数。
  • 通过在跨机柜通信前允许多次本地更新,该算法降低了通信开销,提升了高延迟网络中的效率。
  • 理论分析证实,该方法在具有有界梯度和随机噪声的非凸目标下仍能收敛。
  • 收敛速率受一个与学习率和本地更新次数成反比的项限制,且在超过一定本地步数后收益递减。
  • 实验模拟在多个数据集上验证了该方法,显示出更高的训练效率和更稳定的收敛性。
  • 该方法在最小化数据传输的同时保持了模型准确性,适用于医疗、金融等隐私敏感的多组织协作场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。