Skip to main content
QUICK REVIEW

[論文レビュー] Analysis of Privacy Leakage in Federated Large Language Models

Minh N. Vu, Truc Nguyen|arXiv (Cornell University)|Mar 2, 2024
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

この論文は、大規模言語モデル(LLM)のフェデレーテッドファインチューニングにおけるプライバシー漏洩を調査し、完全結合層および自己注意層を標的とする2つのアクティブなメンバーシップインファレンス攻撃を提案する。これらの攻撃は、BERT、RoBERTa、DistilBERT、GPTモデルにおいて、ほぼ完璧な成功率(最大AUC 0.99)を達成する。理論的分析により、攻撃の妥当な成功が証明され、実験により、微分プライバシーが適用されても深刻なプライバシーリスクが存在することが判明し、パラメータ効率的なFL設定におけるアーキテクチャ上の脆弱性が明らかになった。

ABSTRACT

With the rapid adoption of Federated Learning (FL) as the training and tuning protocol for applications utilizing Large Language Models (LLMs), recent research highlights the need for significant modifications to FL to accommodate the large-scale of LLMs. While substantial adjustments to the protocol have been introduced as a response, comprehensive privacy analysis for the adapted FL protocol is currently lacking. To address this gap, our work delves into an extensive examination of the privacy analysis of FL when used for training LLMs, both from theoretical and practical perspectives. In particular, we design two active membership inference attacks with guaranteed theoretical success rates to assess the privacy leakages of various adapted FL configurations. Our theoretical findings are translated into practical attacks, revealing substantial privacy vulnerabilities in popular LLMs, including BERT, RoBERTa, DistilBERT, and OpenAI's GPTs, across multiple real-world language datasets. Additionally, we conduct thorough experiments to evaluate the privacy leakage of these models when data is protected by state-of-the-art differential privacy (DP) mechanisms.

研究の動機と目的

  • 大規模言語モデル(LLM)のフェデレーテッドラーニング(FL)における包括的なプライバシー分析の不足に対処すること、特にパラメータ効率的なファインチューニング(PET)設定におけるものである。
  • LLM用に変更されたFLプロトコルが、通信オーバーヘッドを低減するが、パラメータの小さなサブセットのみを更新する場合、新たなプライバシー脆弱性を引き起こすかどうかを調査すること。
  • この文脈において、最先端の微分プライバシー(DP)メカニズムがメンバーシップインファレンス攻撃を緩和する効果を評価すること。
  • 現実世界のLLMとデータセットにおける理論的プライバシー保証と実用的攻撃の可能性の間のギャップを埋めること。

提案手法

  • ファインチューニングされたLLMの完全結合(FC)層と自己注意層を標的とする2つのアクティブなメンバーシップインファレンス(AMI)攻撃を提案する。
  • 不正なFLサーバーがFC層の更新を通じて完全なメンバーシップインファレンスを達成できることを証明する理論的枠組みを構築する(定理1)、成功確率の境界を明示的に示す。
  • 自己注意メカニズムにおける勾配パターンを活用する高確率保証の自己注意ベースAMI攻撃を開発する(定理2)。
  • モデル固有の勾配統計とレイヤーごとの特徴表現を用いて、実用的な攻撃を実装し、特定のデータサンプルがクライアントの訓練データセットに含まれていたかどうかを推定する。
  • トークンインデックスレベルで複数の微分プライバシー機構(GRR、RAPPOR、HE、dBitFlipPM)を適用し、提案された攻撃に対する耐性を評価する。
  • 多周波数LDPライブラリ(Multi-Freq-LDPy)を用いてDPの保証を強化するとともに、モデルやデータセット across での攻撃性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1不正なFLサーバーが、ファインチューニングされたLLMにおけるトレーナブルパラメータのみを操作することで、妥当な高い成功確率でメンバーシップインファレンス攻撃を達成できるか?
  • RQ2アダプターやLoRAなどのパラメータ効率的なファインチューニング手法は、フルファインチューニングと比較して、新たなプライバシー攻撃ベクトルをもたらすか?
  • RQ3標準的な微分プライバシー機構は、フェデレーテッド環境下でのLLMに対するメンバーシップインファレンス攻撃を効果的に保護できるか?
  • RQ4アーキテクチャ上の違い(例:エンコーダー対デコーダー)は、LLMのメンバーシップインファレンス攻撃に対する耐性に影響を与えるか?
  • RQ5攻撃成功確率はモデルの異なるレイヤーで変動するか?もしそうなら、最も脆弱なポイントはどこか?

主な発見

  • 完全結合(FC)層ベースの攻撃は、BERTとRoBERTaで最大AUC 0.99、精度0.96を達成し、初期層および中層でのほぼ完璧なメンバーシップインファレンスを示している。
  • 自己注意ベースの攻撃は、BERTで中層でAUC 0.92、RoBERTaでAUC 0.95を達成し、注意メカニズムが重大なプライバシー漏洩を引き起こす可能性があることを示している。
  • 強力なDP保証(ε = 10)下でも、FC-Token攻撃はBERTとRoBERTaで高い成功確率(AUC > 0.90)を維持しており、DP単体ではメンバーシップインファレンスを防止できないことが示された。
  • ガウス機構に基づくDP(GRR)は、すべてのDP機構の中で最も高い攻撃成功確率を示し、性能はモデルや攻撃タイプによって変動する。
  • GPTモデルは、BERTベースのモデルと比較して、注意ベースの攻撃に対してより高い耐性を示しており、アーキテクチャの違い(デコーダー専用対エンコーダー専用)によるものと推定される。
  • 深層に進むにつれて攻撃成功確率は低下するが、BERTとRoBERTaの中期のFC-Token攻撃ではわずかな上昇が観察され、プライバシー漏洩のハイポットが存在する可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。