[论文解读] FLoRA: Federated Fine-Tuning Large Language Models with Heterogeneous Low-Rank Adaptations
FLoRA 提出了一种无噪声、基于堆叠的聚合方法,用于使用异构低秩适配器(LoRAs)对大型语言模型进行联邦微调。通过将本地 LoRA 矩阵堆叠而非平均,FLoRA 消除了数学聚合误差,并支持客户端之间 LoRA 秩的差异,从而在同质和异质设置下均优于当前最先进方法。
The rapid development of Large Language Models (LLMs) has been pivotal in advancing AI, with pre-trained LLMs being adaptable to diverse downstream tasks through fine-tuning. Federated learning (FL) further enhances fine-tuning in a privacy-aware manner by utilizing clients' local data through in-situ computation, eliminating the need for data movement. However, fine-tuning LLMs, given their massive scale of parameters, poses challenges for clients with constrained and heterogeneous resources in FL. Previous methods employed low-rank adaptation (LoRA) for efficient federated fine-tuning but utilized traditional FL aggregation strategies on LoRA adapters. These approaches led to mathematically inaccurate aggregation noise, reducing fine-tuning effectiveness and failing to address heterogeneous LoRAs. In this work, we first highlight the mathematical incorrectness of LoRA aggregation in existing federated fine-tuning methods. We introduce a new approach called FLORA that enables federated fine-tuning on heterogeneous LoRA adapters across clients through a novel stacking-based aggregation method. Our approach is noise-free and seamlessly supports heterogeneous LoRA adapters. Extensive experiments demonstrate FLORA' s superior performance in both homogeneous and heterogeneous settings, surpassing state-of-the-art methods. We envision this work as a milestone for efficient, privacy-preserving, and accurate federated fine-tuning of LLMs. Our code is available at https://github.com/ATP-1010/FederatedLLM.
研究动机与目标
- 解决现有联邦 LoRA 聚合方法中的数学不准确性问题,该问题由于独立平均 LoRA 矩阵 A 和 B 而引入噪声。
- 在现实的异构客户端环境中实现有效的联邦微调,其中客户端具有不同的数据分布和计算资源。
- 支持客户端之间异构的 LoRA 秩,使客户端能够根据本地数据和硬件限制使用不同的适配器秩。
- 开发一种理论严谨的聚合机制,以保持模型更新的完整性,并加速联邦学习中的收敛。
- 在同质和异质 LoRA 设置下,实现大型语言模型微调的最先进性能,同时保持隐私和效率。
提出的方法
- 提出一种基于堆叠的聚合机制,将所有客户端的本地 LoRA 矩阵 A 和 B 沿秩维度连接,形成一个不经过平均的全局 LoRA 矩阵。
- 理论分析证明,堆叠方法保持了全局模型更新的数学正确性,消除了 FedIT 平均方法中存在的中间噪声项。
- 通过允许客户端使用不同的秩来使用其 A 和 B 矩阵,支持异构 LoRA 秩,且堆叠机制可自然容纳这些差异。
- 通过将 LoRA 矩阵拆分为秩-1 子模块并在堆叠前打乱其顺序,引入隐私保护机制,防止恶意客户端重建原始矩阵。
- 与标准隐私机制(如加密和差分隐私)集成,确保与联邦学习的隐私保证兼容。
- 采用标准的 FedAvg 类联邦学习训练循环,其中客户端在设备上微调其本地 LoRA 模块,并将它们上传至服务器,服务器随后应用堆叠操作形成全局模型。
实验结果
研究问题
- RQ1现有联邦 LoRA 方法(如 FedIT)中聚合噪声的数学来源是什么?如何消除?
- RQ2一种联邦微调方法是否能够在保持模型准确性和收敛性的同时,支持客户端之间异构的 LoRA 秩?
- RQ3与基于平均的方法相比,LoRA 矩阵的堆叠聚合机制是否能带来更快的收敛速度和更高的性能?
- RQ4在具有不同数据和硬件资源的现实异构客户端环境中,FLoRA 的表现如何?
- RQ5所提出的堆叠方法能否在不牺牲通信效率的前提下,防范来自全局模型更新的隐私泄露?
主要发现
- FLoRA 通过用堆叠替代平均来消除聚合噪声,该方法在数学上是正确的,可实现更快的收敛。
- 堆叠机制天然支持客户端之间异构的 LoRA 秩,从而促进更广泛的客户端参与联邦微调。
- FLoRA 在多个基准测试中均优于当前最先进方法 FedIT,涵盖 GSM8K、HumanEval 和 WizzAR,在 LLaMA、Llama2 和 TinyLlama 模型上表现优异。
- LoRA 秩为 8 时在所有模型和数据集上均表现出稳定强性能,而极端秩(如 64)的表现则因模型而异,表明最优秩与模型容量之间存在相关性。
- FLoRA 的通信开销仅比 FedIT 略高,且与全参数微调相比仍可忽略不计,因此适用于大规模部署。
- FLoRA 的隐私保护设计(包括秩-1 子模块打乱和与加密及差分隐私的兼容性)可防止恶意客户端重建本地 LoRA 矩阵。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。