Skip to main content
QUICK REVIEW

[論文レビュー] Decepticons: Corrupted Transformers Breach Privacy in Federated Learning for Language Models

Liam Fowl, Jonas Geiping|arXiv (Cornell University)|Jan 29, 2022
Privacy-Preserving Technologies in Data被引用数 10
ひとこと要約

この論文は、フェデレーテッドラーニングにおけるプライバシー侵害攻撃「Decepticons」を紹介する。この攻撃は、改ざんされたTransformerモデルを悪用し、勾配更新からプライベートなユーザーのテキストを抽出する。モデルの埋め込み層を操作し、統計的回復技術を活用することで、バッチ集約、長いシーケンス、ノイズの下でも、高精度なテキストシーケンス(完全なトークンと位置埋め込みを含む)を再構築できる。これは、信頼できないサーバー環境における深刻なプライバシーリスクを示している。

ABSTRACT

A central tenet of Federated learning (FL), which trains models without centralizing user data, is privacy. However, previous work has shown that the gradient updates used in FL can leak user information. While the most industrial uses of FL are for text applications (e.g. keystroke prediction), nearly all attacks on FL privacy have focused on simple image classifiers. We propose a novel attack that reveals private user text by deploying malicious parameter vectors, and which succeeds even with mini-batches, multiple users, and long sequences. Unlike previous attacks on FL, the attack exploits characteristics of both the Transformer architecture and the token embedding, separately extracting tokens and positional embeddings to retrieve high-fidelity text. This work suggests that FL on text, which has historically been resistant to privacy attacks, is far more vulnerable than previously thought.

研究の動機と目的

  • 信頼できないサーバーがユーザーのプライバシーを侵害する可能性がある、NLPアプリケーションにおけるフェデレーテッドラーニングの脆弱性を明らかにすること。
  • 現実的な脅威モデル下で、Transformerベースの言語モデルの勾配更新が、プライベートなテキスト情報を漏洩させるかどうかを調査すること。
  • 集約やノイズが存在する状況でも、トークンの識別子とその絶対的な位置を両方とも再構築する手法を開発すること。
  • 小規模および大規模モデル、特にBERTの10%サイズのモデルに対しても、このような攻撃の実現可能性を評価すること。
  • NLPにおけるフェデレーテッドラーニングで、モデルの集約や小規模なモデルサイズが本質的にプライバシーを保護すると仮定する考えを疑問視すること。

提案手法

  • フェデレーテッドトレーニング中にクライント側のモデル更新を損なうために、悪意のあるパラメータベクトルをサーバーモデルに導入する。
  • Transformerの埋め込み層の構造を活用し、入力埋め込みを勾配エントリにエンコードするために、最初の線形層を共有されたガウスベクトルで初期化する。
  • ReLU活性化関数を用いて、埋め込みベクトルを離散的な勾配エントリにマップすることで、トークンレベルの信号抽出を可能にする。
  • スパース信号回復(例:K-SVDを用いた直交一致追跡)を適用し、勾配バケットごとの埋め込みの累積和をノイズ除去および再構築する。
  • 勾配パターンとバケット戦略の分析により、別々にトークン埋め込みと位置埋め込みを抽出する。
  • 統計的割り当てとしきい値処理(例:1.5標準偏差)を用い、おそらくのトークン一致とその位置を特定する。

実験結果

リサーチクエスチョン

  • RQ1信頼できないサーバーが、フェデレーテッドラーニングにおいて、Transformerベースの言語モデルの勾長更新からプライベートなユーザーのテキストを回復できるか?
  • RQ2バッチ集約やモデルサイズは、NLPにおけるフェデレーテッドラーニングの勾長逆引き攻撃の成功率にどの程度影響を与えるか?
  • RQ3勾長更新のみを用いて、トークンの識別子とその絶対的位置を高精度で回復できるか?
  • RQ4勾長クリッピングやラプラスノイズといった防御対策に対して、攻撃はどの程度耐性を示すか?
  • RQ5信頼できないサーバーを想定する脅威モデルは、現実のフェデレーテッドNLP展開において現実的でかつ深刻な影響を持つものか?

主な発見

  • Decepticon攻撃は、数千トークンにわたる長さのシーケンスに対しても、完全なテキストシーケンス(トークンの識別子と絶対的位置を含む)を高精度で再構築できることを示した。
  • 100人以上のユーザーを含むバッチ集約に対しても攻撃が有効であることが確認され、単一ユーザーまたは小規模バッチ設定を超えたスケーラビリティを示している。
  • 小規模モデル(BERTの10%サイズ)に対しても再構築が可能であるため、モデルサイズそのものがプライバシー保護を保証するわけではないことが示された。
  • 勾長クリッピングやラプラスノイズに対しても、攻撃の成功率が高く維持されることから、一般的な防御対策に対しても耐性があることがわかった。
  • 3層Transformerでは約4,096、GPT-2では36,864の総漏洩トークン数がピークに達し、バッチサイズやシーケンス長に応じて変動することから、顕著なデータ漏洩リスクを示している。
  • 入力の大部分に対して正確なトークンおよび位置の回復が達成されており、高ノイズレベルでは予測可能な程度で性能が低下するが、依然として高い成功率を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。