Skip to main content
QUICK REVIEW

[論文レビュー] CAFE: Catastrophic Data Leakage in Vertical Federated Learning

Xiao Jin, Pin‐Yu Chen|arXiv (Cornell University)|Oct 26, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用数 15
ひとこと要約

CAFE は、データインデックスと内部表現の整合性を用いて、共有された集約勾配から大規模バッチの訓練データを効率的に回復する、垂直フェデレーテッドラーニングにおける新規なデータ漏洩攻撃である。理論的保証とともにより優れた回復品質を達成し、現実的な訓練条件下でも、顔画像を含む機微なデータの高精細再構成を実現している。

ABSTRACT

Recent studies show that private training data can be leaked through the gradients sharing mechanism deployed in distributed machine learning systems, such as federated learning (FL). Increasing batch size to complicate data recovery is often viewed as a promising defense strategy against data leakage. In this paper, we revisit this defense premise and propose an advanced data leakage attack with theoretical justification to efficiently recover batch data from the shared aggregated gradients. We name our proposed method as catastrophic data leakage in vertical federated learning (CAFE). Comparing to existing data leakage attacks, our extensive experimental results on vertical FL settings demonstrate the effectiveness of CAFE to perform large-batch data leakage attack with improved data recovery quality. We also propose a practical countermeasure to mitigate CAFE. Our results suggest that private data participated in standard FL, especially the vertical case, have a high risk of being leaked from the training gradients. Our analysis implies unprecedented and practical data leakage risks in those learning settings. The code of our work is available at https://github.com/DeRafael/CAFE.

研究の動機と目的

  • 共有勾配を通じた垂直フェデレーテッドラーニング(VFL)における機微なデータ漏洩の深刻な脆弱性を露見し、より大きなバッチサイズでは漏洩が防げるとの仮定に疑問を呈する。
  • 従来の手法が失敗する VFL 環境において、大規模バッチの訓練データを回復可能なスケーラブルで理論的根拠を持つデータ漏洩攻撃を開発する。
  • モデルの訓練性能を損なわずにデータ漏洩を緩和する実用的な防御メカニズム(フェイク勾配)を提供する。
  • CAFE の有効性を、CIFAR-10 や Yale 顔データなど実世界のデータセットも含む静的および動的訓練シナリオにおいて、実証的に検証する。

提案手法

  • 垂直 FL における各ワーカー間でのデータインデックスの整合性を活用し、勾配を特定の訓練サンプルに関連付ける。
  • 内部表現の整合性を用いて、最初の全結合層の直前における隠れ層活性化(H)を共有勾配から回復する。
  • 3段階の回復プロセスを適用する:(1) 最初の FC 層出力に関する勾配を回復し、(2) 最初の FC 層入力を回復し、(3) これらの入力を用いて元のデータを再構成する。
  • 特に大規模バッチ設定下でも再構成の忠実度を向上させるために、新規な損失関数と最適化戦略を採用する。
  • 訓練中に意図的にノイズを注入するフェイク勾配を用いた防御メカニズムを導入し、攻撃を阻害する。
  • フェイク勾配手法は、標準的な最適化(例:SGD)と互換性があり、モデルの再トレーニングやアーキテクチャの変更を必要としない。

実験結果

リサーチクエスチョン

  • RQ1大規模バッチのデータは、一般的にバッチサイズが大きいと漏洩が防げると考えられているが、垂直フェデレーテッドラーニングにおける共有勾配から効果的に回復可能か?
  • RQ2VFL における勾配ベース攻撃のデータ回復性能に対して、どのような理論的保証を提供できるか?
  • RQ3DLG やコサイン類似度、SAPAG といった既存手法と比較して、提案される CAFE 攻撃は再構成品質およびスケーラビリティにおいてどのように優れているか?
  • RQ4モデルの訓練性能を低下させることなく、データ漏洩を遮断する実用的な防御メカニズムを設計可能か?
  • RQ5モデルの継続的訓練中においても攻撃は効果を保つのか?また、学習率の変更が回復成功に与える影響はどの程度か?

主な発見

  • CIFAR-10 ではバッチサイズ 40 の条件下で PSNR 31.24、Linnaeus 5 では 30.74 を達成し、DLG やコサイン類似度といった従来手法を顕著に上回った。
  • Yale 顔データセットでは PSNR 42 を超える結果を示し、機微な顔画像の高精細再構成を実証した。
  • 動的訓練シナリオにおいても、モデルが収束している状態(例:MNIST で 20,000 イテレーション目では PSNR = 20.72)においても、PSNR > 20 の再構成を成功させた。
  • フェイク勾配防御により、実際の勾配を使用した場合の PSNR 28.68 を、フェイク勾配を使用した場合の 7.67 にまで低下させ、漏洩の効果的抑制を達成した。
  • フェイク勾配を用いた訓練プロセスは、モデルの精度(例:MNIST で 0.68)と損失の安定性が同等を保ち、防御がモデル性能に悪影響を及げないことを確認した。
  • 4 人から 16 人のワーカーという異なるワーカー数においても CAFE の性能が一貫しており、実際の VFL デプロイメントにおけるスケーラビリティと耐障害性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。