Skip to main content
QUICK REVIEW

[论文解读] Decepticons: Corrupted Transformers Breach Privacy in Federated Learning for Language Models

Liam Fowl, Jonas Geiping|arXiv (Cornell University)|Jan 29, 2022
Privacy-Preserving Technologies in Data被引用 10
一句话总结

本文提出了 Decepticons,一种新型联邦学习隐私攻击,利用受损的 Transformer 模型从梯度更新中提取私有用户文本。通过操纵模型的嵌入层并结合统计恢复技术,该攻击即使在批量聚合、长序列和噪声存在的情况下,也能重建高保真度的文本序列——包括完整标记和位置嵌入,揭示了在不受信任的服务器环境下严重的隐私风险。

ABSTRACT

A central tenet of Federated learning (FL), which trains models without centralizing user data, is privacy. However, previous work has shown that the gradient updates used in FL can leak user information. While the most industrial uses of FL are for text applications (e.g. keystroke prediction), nearly all attacks on FL privacy have focused on simple image classifiers. We propose a novel attack that reveals private user text by deploying malicious parameter vectors, and which succeeds even with mini-batches, multiple users, and long sequences. Unlike previous attacks on FL, the attack exploits characteristics of both the Transformer architecture and the token embedding, separately extracting tokens and positional embeddings to retrieve high-fidelity text. This work suggests that FL on text, which has historically been resistant to privacy attacks, is far more vulnerable than previously thought.

研究动机与目标

  • 揭示在不受信任的服务器环境下,自然语言处理应用中联邦学习的隐私脆弱性。
  • 探究在现实威胁模型下,基于 Transformer 的语言模型的梯度更新是否泄露私有文本信息。
  • 开发一种方法,即使在聚合和噪声存在的情况下,也能从模型梯度中恢复标记身份及其绝对位置。
  • 评估此类攻击在小型和大型模型上的可行性,包括大小为 BERT 10% 的模型。
  • 挑战在联邦学习中自然语言处理领域,模型聚合或小模型尺寸本身能天然保护隐私的假设。

提出的方法

  • 在服务器模型中部署恶意参数向量,以在联邦训练期间污染客户端模型的更新。
  • 通过使用共享高斯向量初始化第一个线性层,利用 Transformer 嵌入层的结构,将输入嵌入编码到梯度条目中。
  • 使用 ReLU 激活函数将嵌入向量映射到离散的梯度条目,从而实现标记级别的信号提取。
  • 应用稀疏信号恢复(例如,通过 K-SVD 的正交匹配追踪)以去噪并重建梯度桶中嵌入的累积和。
  • 通过分析梯度模式和分桶策略,分别提取标记嵌入和位置嵌入。
  • 使用统计分配和阈值处理(例如,1.5 个标准差)识别可能的标记匹配及其位置。

实验结果

研究问题

  • RQ1在联邦学习中,恶意服务器是否能从基于 Transformer 的语言模型的梯度更新中恢复私有用户文本?
  • RQ2批量聚合或模型尺寸在多大程度上影响联邦学习中自然语言处理的梯度反演攻击成功率?
  • RQ3是否能仅通过梯度更新以高保真度恢复标记身份及其绝对位置?
  • RQ4该攻击对梯度裁剪和拉普拉斯噪声等防御措施的鲁棒性如何?
  • RQ5恶意服务器的威胁模型在现实世界联邦自然语言处理部署中是否现实且具有显著影响?

主要发现

  • Decepticon 攻击即使在长达数千个标记的序列下,也能以高保真度成功恢复完整的文本序列,包括标记身份和其绝对位置。
  • 该攻击在涉及超过 100 名用户的批量聚合下依然有效,表明其可扩展性超越单用户或小批量设置。
  • 即使在小型模型(大小为 BERT 的 10%)上,重建也依然可行,表明模型尺寸本身并不能确保隐私保护。
  • 该攻击在梯度裁剪和拉普拉斯噪声下仍保持高成功率,显示出对常见防御措施的鲁棒性。
  • 泄漏的总标记数在 3 层 Transformer 上峰值约为 4,096,在 GPT-2 上峰值为 36,864,具体取决于批量大小和序列长度,表明存在显著的数据泄露潜力。
  • 该方法在相当大比例的输入上实现了精确的标记和位置恢复,仅在高噪声水平下成功率呈可预测的下降趋势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。