[论文解读] FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language Models
FedBPT 是一种新颖的联邦学习框架,可在无需访问模型参数的情况下,实现高效且保护隐私的大规模语言模型(LLMs)提示调优。通过使用无梯度优化(CMA-ES)在本地训练提示,并仅交换低维提示向量,FedBPT 相较于基于梯度的基线方法,将通信成本降低了超过 500,000 倍,内存使用量减少了 3 倍,同时实现了与最先进方法相当的准确率。
Pre-trained language models (PLM) have revolutionized the NLP landscape, achieving stellar performances across diverse tasks. These models, while benefiting from vast training data, often require fine-tuning on specific data to cater to distinct downstream tasks. However, this data adaptation process has inherent security and privacy concerns, primarily when leveraging user-generated, device-residing data. Federated learning (FL) provides a solution, allowing collaborative model fine-tuning without centralized data collection. However, applying FL to finetune PLMs is hampered by challenges, including restricted model parameter access, high computational requirements, and communication overheads. This paper introduces Federated Black-box Prompt Tuning (FedBPT), a framework designed to address these challenges. FedBPT does not require the clients to access the model parameters. By focusing on training optimal prompts and utilizing gradient-free optimization methods, FedBPT reduces the number of exchanged variables, boosts communication efficiency, and minimizes computational and storage costs. Experiments highlight the framework's ability to drastically cut communication and memory costs while maintaining competitive performance. Ultimately, FedBPT presents a promising solution for efficient, privacy-preserving fine-tuning of PLM in the age of large language models.
研究动机与目标
- 解决在联邦学习设置中微调大规模语言模型(LLMs)所面临的挑战,其中客户端无法访问模型参数,并面临高昂的计算、存储和通信成本。
- 仅通过推理访问实现对黑箱 LLM 的高效、隐私保护的适应,避免反向传播和参数更新的需要。
- 通过仅交换提示向量(数百个参数)而非模型权重或梯度(数百万至数十亿个参数),显著降低联邦学习中的通信开销。
- 在资源受限的边缘设备(如智能手机和 AR 头戴设备)上保持与基于梯度的微调方法相当的性能。
- 通过保持可训练参数数量恒定,无论模型大小如何,实现与更大规模 LLM 的高效扩展。
提出的方法
- 客户端使用 CMA-ES(一种无梯度优化方法)在本地执行提示优化,无需访问模型参数或执行反向传播。
- 在本地训练期间仅需通过冻结的 LLM 执行前向传播,从而在边缘设备上最小化计算和存储成本。
- 服务器聚合本地优化的提示分布,并将全局提示分布发送回客户端以进行下一轮训练。
- 对输入标记应用具有可控零值率($r_p$)的二值掩码,以在本地提示搜索过程中防止过拟合。
- 通过低维投影矩阵将嵌入空间映射到更小的空间,从而在紧凑的提示向量上实现高效的 CMA-ES 优化。
- 框架仅交换提示参数(例如 500 个参数),而非模型权重或梯度,从而极大减少通信量。
实验结果
研究问题
- RQ1在无需访问模型参数的情况下,无梯度优化是否能在联邦设置中有效用于提示调优?
- RQ2在保持竞争力性能的前提下,联邦 LLM 微调中的通信和内存成本可降低到何种程度?
- RQ3与基于梯度的方法和人工提示基线相比,FedBPT 在非独立同分布(non-IID)数据分布下的表现如何?
- RQ4随着 LLM 规模的增加,该框架是否能保持低计算和通信开销,实现高效扩展?
- RQ5哪些超参数(如本地种群大小($\lambda_k$)和掩码率($r_p$))显著影响模型的准确率和鲁棒性?
主要发现
- 与 FedP-tuning 等基于梯度的方法相比,FedBPT 通过仅交换 4KB 的提示参数,将通信成本降低了超过 500,000 倍,后者每轮需传输近 2GB。
- 即使未采用额外的高效推理技术,FedBPT 的内存占用也比基于梯度的方法减少了 3 倍以上。
- 在非独立同分布设置下,FedBPT 在 SST-2、AG’s News 和 Yelp 数据集上分别比人工提示提高了 12%、11% 和 13% 的准确率。
- FedBPT 在性能上与 FedPrompt 和 FedP-tuning 等基于梯度的方法相当,尤其在梯度方法性能显著下降的非独立同分布设置中表现更优。
- FedBPT 的模型准确率对本地种群大小($\lambda_k$)不敏感,因此可设置为较小值(如 5–20),以降低计算成本。
- 应用具有 $r_p = 0.6$ 的随机二值掩码相比原始 BBT($r_p = 0$)可将准确率提高最多 1.6%,证明其在缓解本地过拟合方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。