Skip to main content
QUICK REVIEW

[论文解读] BAFFLE: A Baseline of Backpropagation-Free Federated Learning

Haozhe Feng, Tianyu Pang|arXiv (Cornell University)|Jan 28, 2023
Privacy-Preserving Technologies in Data被引用 6
一句话总结

BAFFLE 提出了一种无需反向传播的联邦学习框架,通过使用随机扰动的多次前向传播来估计梯度,替代梯度计算。该方法在显著降低内存和计算开销的同时,实现了可接受的模型准确率,从而能够在资源受限的边缘设备和可信执行环境(TEEs)中部署。

ABSTRACT

Federated learning (FL) is a general principle for decentralized clients to train a server model collectively without sharing local data. FL is a promising framework with practical applications, but its standard training paradigm requires the clients to backpropagate through the model to compute gradients. Since these clients are typically edge devices and not fully trusted, executing backpropagation on them incurs computational and storage overhead as well as white-box vulnerability. In light of this, we develop backpropagation-free federated learning, dubbed BAFFLE, in which backpropagation is replaced by multiple forward processes to estimate gradients. BAFFLE is 1) memory-efficient and easily fits uploading bandwidth; 2) compatible with inference-only hardware optimization and model quantization or pruning; and 3) well-suited to trusted execution environments, because the clients in BAFFLE only execute forward propagation and return a set of scalars to the server. Empirically we use BAFFLE to train deep models from scratch or to finetune pretrained models, achieving acceptable results. Code is available in https://github.com/FengHZ/BAFFLE.

研究动机与目标

  • 解决在资源受限的边缘设备上联邦学习中反向传播带来的计算和内存开销问题。
  • 通过消除向客户端暴露模型参数的需求,缓解联邦学习中的白盒漏洞。
  • 实现与仅支持推理的硬件、模型量化、剪枝以及可信执行环境(TEEs)的兼容性。
  • 探索零阶优化在联邦学习中的可行性,以减少对梯度计算的依赖。

提出的方法

  • 使用在扰动模型权重上的多次前向传播,通过有限差分近似来估计梯度,替代反向传播。
  • 每个客户端使用来自共享随机种子的随机噪声向量 $ \bm{\nu}_k $ 对全局模型参数进行 $ K $ 次扰动。
  • 客户端通过在其本地数据上的前向推理计算损失差异 $ \triangle \tilde{\theta} = \tilde{\theta}(\boldsymbol{W} + \bm{\nu}_k) - \tilde{\theta}(\boldsymbol{W} - \bm{\nu}_k) $。
  • 服务器使用安全聚合技术聚合这些标量损失差异,以估计完整的梯度向量。
  • 通过调整 $ K $ 控制通信带宽,因为每个损失差异仅是一个浮点数。
  • 利用逐层计算切分和逐核优化,最小化边缘设备上的静态和动态内存使用。

实验结果

研究问题

  • RQ1是否可以通过仅依赖前向传播和有限差分法估计梯度,在无需反向传播的情况下有效训练联邦学习?
  • RQ2与基于标准反向传播的联邦学习相比,BAFFLE 在边缘设备上在多大程度上减少了内存和计算开销?
  • RQ3在从零开始训练或微调预训练模型时,BAFFLE 在模型准确率和收敛性方面表现如何?
  • RQ4由于其极低的内存占用和未暴露模型参数,BAFFLE 是否能够安全地集成到可信执行环境(TEEs)中?
  • RQ5从标量损失差异 $ \triangle \tilde{\theta} $ 中的信息泄露风险有多大,与基于标准推理的攻击相比如何?

主要发现

  • 在 MNIST、CIFAR-10/100 和 OfficeHome 数据集上,BAFFLE 实现了次优但可接受的性能,当微调 ImageNet 预训练的 MobileNet 时,准确率与标准联邦学习相差仅 3%–5%。
  • 通过将计算图切分为逐层推理,该方法将内存使用量降低至标准反向传播的 5%–10%;通过逐核优化,可进一步降低至约 1%(例如,MobileNet 为 64MB)。
  • 由于其低内存占用,BAFFLE 与 TEE 兼容——实现约 64MB 的内存使用量,符合典型 TEE 限制(如 Intel SGX 的 90MB)。
  • 实证结果表明,真实数据和随机噪声产生的损失差异 $ \triangle \tilde{\theta} $ 无法区分,表明其对成员推断攻击和模型反演攻击具有抗性。
  • 通过适当的训练策略(如迁移学习),在 OfficeHome 数据集上 $ K $ 可减少至 20,使计算成本降低至基于反向传播的联邦学习的约 $ \frac{K}{5} $ 倍。
  • 该方法证明了通过前向传播实现的零阶优化在联邦学习中是可行的,尤其适用于边缘设备不支持反向传播的场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。