[论文解读] Server-Side Local Gradient Averaging and Learning Rate Acceleration for Scalable Split Learning
本文提出SGLR,一种可扩展的分割学习框架,通过服务器端局部梯度平均(SplitAvg)和学习率分割(SplitLr)解决了并行分割学习中的关键瓶颈。通过在服务器端对梯度进行平均并解耦客户端与服务器的学习率,SGLR在准确率上优于基线SL和SFL,同时与SFL相比通信开销降低88.6%,与FL相比降低95.5%,性能与FL相当,但能耗和通信成本更低。
In recent years, there have been great advances in the field of decentralized learning with private data. Federated learning (FL) and split learning (SL) are two spearheads possessing their pros and cons, and are suited for many user clients and large models, respectively. To enjoy both benefits, hybrid approaches such as SplitFed have emerged of late, yet their fundamentals have still been illusive. In this work, we first identify the fundamental bottlenecks of SL, and thereby propose a scalable SL framework, coined SGLR. The server under SGLR broadcasts a common gradient averaged at the split-layer, emulating FL without any additional communication across clients as opposed to SplitFed. Meanwhile, SGLR splits the learning rate into its server-side and client-side rates, and separately adjusts them to support many clients in parallel. Simulation results corroborate that SGLR achieves higher accuracy than other baseline SL methods including SplitFed, which is even on par with FL consuming higher energy and communication costs. As a secondary result, we observe greater reduction in leakage of sensitive information via mutual information using SLGR over the baselines.
研究动机与目标
- 为解决并行分割学习中的可扩展性限制,特别是服务器端有效批量过大和反向传播客户端解耦问题。
- 实现在不增加额外通信成本的前提下,跨大量客户端的高效、可扩展训练。
- 相比现有分割学习和混合FL-SL方法,提升模型准确率并减少信息泄露。
- 在显著降低通信和能耗开销的同时,实现与联邦学习相当的性能。
提出的方法
- 提出SplitAvg:在分割层对客户端梯度进行服务器端平均,实现将统一梯度广播至所有客户端。
- 提出SplitLr:将学习率解耦为客户端和服务器端组件,以独立优化收敛速度。
- 在服务器端使用梯度平均以解决反向传播客户端解耦问题,确保所有客户端均能从集体更新中受益。
- 采用通信高效的架构,每批次仅广播一次梯度,避免对每个客户端单独发送。
- 在现有分割学习流程基础上,通过引入服务器端梯度聚合和自适应学习率进行增强。
- 利用闭式表达式分析通信开销和训练时间,推导总通信量和训练时长。
实验结果
研究问题
- RQ1如何在不增加通信成本的前提下,使分割学习在大量客户端上实现可扩展?
- RQ2服务器端梯度平均对并行分割学习中模型收敛性和客户端解耦有何影响?
- RQ3学习率分割能否提升在大模型上的分割学习框架中的训练稳定性和准确率?
- RQ4SGLR在准确率、通信成本和隐私泄露方面与联邦学习相比如何?
- RQ5SGLR相较于现有分割学习和混合FL-SL方法,在理论通信效率和训练时间效率方面有何提升?
主要发现
- 在100个客户端和AlexNet的设置下,SGLR相比SFL将总通信开销降低了88.6%,相比FL降低了95.5%。
- 尽管FL的通信和能耗成本更高,SGLR仍实现了与联邦学习相当的准确率。
- SGLR的训练时间始终低于SL和SFL,且在大模型情况下与FL相当,表现出良好竞争力。
- 与基线SL和SFL方法相比,SGLR通过互信息分析显示出更显著的信息泄露减少。
- 该框架保持了高可扩展性,通过高效的梯度广播和学习率解耦,支持大量客户端并行训练。
- 当模型尺寸较大且本地数据不过分庞大时,通信效率的提升最为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。