Skip to main content
QUICK REVIEW

[论文解读] A Secure and Efficient Federated Learning Framework for NLP

Jie‐Ren Deng, Chenghong Wang|arXiv (Cornell University)|Jan 28, 2022
Privacy-Preserving Technologies in Data被引用 6
一句话总结

本文提出 SEFL,一种用于 NLP 的安全且高效的联邦学习框架,通过使用两个不共谋的服务器(聚合服务器与密码服务提供商),消除了对可信聚合器的依赖。该框架在保持与现有方法相当或更优的模型准确率的同时,通过基于分块 Hankel 矩阵的模型权重与更新剪枝技术,将运行时性能提升最高达 13.7 倍,并能有效应对客户端掉线问题。

ABSTRACT

In this work, we consider the problem of designing secure and efficient federated learning (FL) frameworks. Existing solutions either involve a trusted aggregator or require heavyweight cryptographic primitives, which degrades performance significantly. Moreover, many existing secure FL designs work only under the restrictive assumption that none of the clients can be dropped out from the training protocol. To tackle these problems, we propose SEFL, a secure and efficient FL framework that (1) eliminates the need for the trusted entities; (2) achieves similar and even better model accuracy compared with existing FL designs; (3) is resilient to client dropouts. Through extensive experimental studies on natural language processing (NLP) tasks, we demonstrate that the SEFL achieves comparable accuracy compared to existing FL solutions, and the proposed pruning technique can improve runtime performance up to 13.7x.

研究动机与目标

  • 解决现有联邦学习框架依赖可信聚合器或易受客户端掉线影响的局限性。
  • 设计一种无需可信第三方的、可保护差分隐私的安全联邦学习系统。
  • 降低 RNN 和 Transformer 等 NLP 模型在安全联邦学习中的计算、通信和存储开销。
  • 即使在训练过程中高达 75% 的客户端掉线时,也能实现稳健的训练。
  • 集成高效的剪枝技术,在不牺牲准确率的前提下减小模型规模并提升运行时性能。

提出的方法

  • SEFL 使用两个不共谋的服务器:聚合服务器(AS)负责收集并安全聚合加密的模型更新,密码服务提供商(CSP)持有解密密钥。
  • 框架采用加法同态加密(AHE),实现对加密模型更新的安全聚合,而无需暴露单个客户端的贡献。
  • 通过高斯机制实施差分隐私,注入与模型敏感度成比例的噪声,以防范成员推断攻击。
  • 采用基于分块 Hankel 矩阵(BHM)的本地剪枝技术,压缩模型权重与更新,将空间与通信复杂度从 O(l²) 降低至 O(2l−1)。
  • 剪枝在传输前于本地执行,最大限度减少传输数据量,并降低差分隐私聚合步骤中的噪声注入次数。
  • 系统设计确保在高客户端掉线率下,模型准确率与收敛性仍能保持,通过确保全局模型在缺少更新的情况下依然稳定。

实验结果

研究问题

  • RQ1能否在不依赖可信聚合器的前提下,使联邦学习框架实现强隐私保障?
  • RQ2在安全联邦学习中,如何有效应对客户端掉线而不降低模型准确率?
  • RQ3通过基于分块 Hankel 矩阵的剪枝,能在多大程度上降低安全联邦学习中 NLP 模型的通信与计算开销?
  • RQ4将剪枝与差分隐私结合,是否能同时提升联邦学习的效率与模型准确率?
  • RQ5安全联邦学习系统在仍能生成准确模型的前提下,最多可容忍多少比例的客户端掉线?

主要发现

  • 与最先进的私有联邦学习方法(如 CDP-FL)相比,SEFL 实现了相当或更高的模型准确率,使用剪枝时在 Transformer 模型上准确率最高提升 15%,在 LSTM 模型上提升 11%。
  • 所提出的基于 BHM 的剪枝技术使运行时性能相比未剪枝的 SEFL 提升最高达 13.7 倍,适用于 LSTM 与 Transformer 模型。
  • 即使在 75% 客户端掉线的情况下,SEFL 仍能保持模型质量,LSTM 模型与 Transformer 模型的困惑度分别仅比无掉线情况高出 17.41 和 46.34。
  • 在最优剪枝配置下,优化后的 SEFL 相较于未优化的 SEFL,在 LSTM 模型上实现 19.3% 的准确率提升,在 Transformer 模型上实现 12.8% 的准确率提升。
  • 框架将模型表示复杂度从 O(l²) 降低至 O(2l−1),显著降低了存储与通信成本。
  • SEFL 展现出对客户端掉线的强健性,即使多数客户端离线,仍能保持稳定的收敛性与准确的全局模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。