Skip to main content
QUICK REVIEW

[论文解读] Analysis of Privacy Leakage in Federated Large Language Models

Minh N. Vu, Truc Nguyen|arXiv (Cornell University)|Mar 2, 2024
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文研究了在大型语言模型(LLMs)的联邦微调过程中存在的隐私泄露问题,提出两种主动成员推理攻击——分别针对全连接层和自注意力层——在 BERT、RoBERTa、DistilBERT 和 GPT 模型上实现了接近完美的成功率(AUC 最高达 0.99)。理论分析证明了攻击的成功具有可证明性,实验结果证实即使在差分隐私保护下仍存在严重的隐私风险,揭示了参数高效联邦学习设置中的架构脆弱性。

ABSTRACT

With the rapid adoption of Federated Learning (FL) as the training and tuning protocol for applications utilizing Large Language Models (LLMs), recent research highlights the need for significant modifications to FL to accommodate the large-scale of LLMs. While substantial adjustments to the protocol have been introduced as a response, comprehensive privacy analysis for the adapted FL protocol is currently lacking. To address this gap, our work delves into an extensive examination of the privacy analysis of FL when used for training LLMs, both from theoretical and practical perspectives. In particular, we design two active membership inference attacks with guaranteed theoretical success rates to assess the privacy leakages of various adapted FL configurations. Our theoretical findings are translated into practical attacks, revealing substantial privacy vulnerabilities in popular LLMs, including BERT, RoBERTa, DistilBERT, and OpenAI's GPTs, across multiple real-world language datasets. Additionally, we conduct thorough experiments to evaluate the privacy leakage of these models when data is protected by state-of-the-art differential privacy (DP) mechanisms.

研究动机与目标

  • 为解决联邦学习(FL)在大型语言模型(LLMs)中缺乏全面隐私分析的问题,特别是参数高效微调(PET)配置下的问题。
  • 探究针对 LLM 的改进联邦协议(仅更新少量参数)是否在降低通信开销的同时引入新的隐私漏洞。
  • 评估最先进的差分隐私(DP)机制在此情境下缓解成员推理攻击的有效性。
  • 弥合理论隐私保证与现实世界 LLM 及数据集中的实际攻击可行性之间的差距。

提出的方法

  • 提出两种主动成员推理(AMI)攻击:一种针对微调后 LLM 中的全连接(FC)层,另一种针对自注意力层。
  • 设计理论框架,证明恶意联邦服务器可通过 FC 层更新实现完美成员推理(定理 1),并给出可证明的成功率边界。
  • 开发基于自注意力机制的 AMI 攻击,具有高保证的成功率(定理 2),利用注意力机制中的梯度模式。
  • 通过使用模型特定的梯度统计量和逐层特征表示,实现实际攻击,以推断某一样本是否属于客户端的训练集。
  • 在标记索引级别应用多种差分隐私机制(GRR、RAPPOR、HE、dBitFlipPM),评估其对所提攻击的抗性。
  • 采用多频带 LDP 库(Multi-Freq-LDPy)以确保 DP 保障,同时在不同模型和数据集上测量攻击性能。

实验结果

研究问题

  • RQ1恶意联邦服务器是否仅通过操纵微调后 LLM 中的可训练参数,就能实现可证明的高成功率成员推理攻击?
  • RQ2在联邦学习中,如使用适配器或 LoRA 等参数高效微调方法,是否相比全量微调引入了新的隐私攻击向量?
  • RQ3标准差分隐私机制在保护 LLM 免受联邦设置中成员推理攻击方面的有效性如何?
  • RQ4是否存在架构差异(如编码器与解码器)影响 LLM 对成员推理攻击的抗性?
  • RQ5攻击成功率是否在模型的不同层之间存在差异?若存在,最脆弱的节点位于何处?

主要发现

  • 基于全连接(FC)层的攻击在 BERT 和 RoBERTa 上达到最大 AUC 0.99 和准确率 0.96,表明在早期和中间层实现了近乎完美的成员推理。
  • 基于自注意力机制的攻击在 BERT 的中间层 AUC 达 0.92,在 RoBERTa 上达 0.95,表明注意力机制同样暴露了显著的隐私泄露。
  • 即使在强差分隐私保障下(ε = 10),FC-Token 攻击在 BERT 和 RoBERTa 上仍保持高成功率(AUC > 0.90),表明 DP 单独不足以防止成员推理。
  • 基于高斯机制的 DP(GRR)在所有 DP 机制中产生最高的攻击成功率,且性能在不同模型和攻击类型间存在差异。
  • GPT 模型对基于注意力的攻击表现出比 BERT 基础模型更强的抗性,可能源于架构差异(仅解码器 vs. 仅编码器)。
  • 随着网络深度增加,攻击成功率下降,但在 BERT 和 RoBERTa 的中间层 FC-Token 攻击中观察到轻微上升,表明可能存在隐私泄露热点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。