Skip to main content
QUICK REVIEW

[論文レビュー] LOKI: Large-scale Data Reconstruction Attack against Federated Learning through Model Manipulation

Joshua C. Zhao, Atul Sharma|arXiv (Cornell University)|Mar 21, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

LOKI は、フェデレーテッドラーニングにおける新しいデータ再構築攻撃であり、悪意あるサーバーが、セキュアアグリゲーションを用いた FedAVG において、カスタム化された畳み込みカーネルを注入することで、クライアントデータの 76–86% を再構築可能にする。攻撃はアイデンティティマッピング層を介した勾配分離を活用し、セキュアアグリゲーションを回避し、モデルの不整合性や攻撃タイミングの事前知識なしに大規模かつ高精度な再構築を可能にする。

ABSTRACT

Federated learning was introduced to enable machine learning over large decentralized datasets while promising privacy by eliminating the need for data sharing. Despite this, prior work has shown that shared gradients often contain private information and attackers can gain knowledge either through malicious modification of the architecture and parameters or by using optimization to approximate user data from the shared gradients. However, prior data reconstruction attacks have been limited in setting and scale, as most works target FedSGD and limit the attack to single-client gradients. Many of these attacks fail in the more practical setting of FedAVG or if updates are aggregated together using secure aggregation. Data reconstruction becomes significantly more difficult, resulting in limited attack scale and/or decreased reconstruction quality. When both FedAVG and secure aggregation are used, there is no current method that is able to attack multiple clients concurrently in a federated learning setting. In this work we introduce LOKI, an attack that overcomes previous limitations and also breaks the anonymity of aggregation as the leaked data is identifiable and directly tied back to the clients they come from. Our design sends clients customized convolutional parameters, and the weight gradients of data points between clients remain separate even through aggregation. With FedAVG and aggregation across 100 clients, prior work can leak less than 1% of images on MNIST, CIFAR-100, and Tiny ImageNet. Using only a single training round, LOKI is able to leak 76-86% of all data samples.

研究の動機と目的

  • 現実的な条件(FedAVG とセキュアアグリゲーションを含む)におけるスケーラブルで高精度なデータ再構築攻撃の欠如に対処すること。
  • 過去の攻撃が単一クライアントや小規模バッチサイズにとどまるという限界を克服すること。
  • モデルの不整合を避けて検出されず、集約された勾配からプライベートデータを再構築できるように、悪意あるサーバーが可能になること。
  • モデルパラメータがサーバーによって操作されると、セキュアアグリゲーションが完全にデータ漏洩を防げないことを示すこと。
  • 微分プライバシーが全トレーニングステップに一様に適用された場合でも、攻撃が有効に残ることを示すこと。

提案手法

  • サーバーは、クライアントに送信する前に、グローバルモデルにアイデンティティマッピング特性を持つカスタム畳み込み層を挿入し、集約後に各クライアントの重み勾配が分離可能であることを保証する。
  • 各クライアントのモデルは、入力特徴を共有された潜在空間にマッピングする独自の畳み込みカーネルで変更され、集約後もクライアント固有の勾配信号が保持される。
  • 攻撃は最終畳み込み層およびその直後の全結合層を漏洩モジュールとして活用し、勾配から入力データの正確な再構築を可能にする。
  • 畳み込みスケーリング要因を用いることで、クライアントが複数ラウンドにわたりローカルにトレーニングしても、勾配の分離性を維持し、モデルの不整合を回避する。
  • サーバーは、注入された畳み込み層の既知の構造を用いて、共有勾配から導かれる線形方程式系を解くことでデータを再構築する。
  • 攻撃は、ResNet や VGG などの標準アーキテクチャに埋め込めるため、計算能力に制限されたクライアントでは検出が困難であり、スパイアシーである。

実験結果

リサーチクエスチョン

  • RQ1悪意あるサーバーは、勾配の混合により過去の攻撃が失敗する可能性がある FedAVG とセキュアアグリゲーションの下で、大規模にプライベートクライアントデータを再構築可能か?
  • RQ2フェデレーテッドトレーニング中にモデルの不整合や検出を避けながら、高い再構築品質を維持するにはどうすればよいか?
  • RQ3どのようなアーキテクチャ的変更が、セキュアアグリゲーションの下でも複数クライアントにわたる勾配分離を可能にするか?
  • RQ4攻撃のスケーラビリティは、クライアント数やローカルデータセットサイズの増加に伴いどの程度向上するか?
  • RQ5微分プライバシーが全トレーニングステップに一様に適用された場合でも、攻撃は有効に残るか?

主な発見

  • LOKI は、MNIST、CIFAR-100、Tiny ImageNet において、100クライアントで1回のトレーニングラウンドのみを用いて、FedAVG とセキュアアグリゲーションの下で 76–86% のデータ漏洩率を達成した。
  • この条件下で、過去最高の技術は 1% 未満のデータ漏洩にとどまっていたが、LOKI はその 76x–86x のスケール向上を示し、最先端技術を凌駕した。
  • 最大プーリング後でさえも高い再構築品質を維持しており、解像度の低下にもかかわらずコンテンツの明瞭さが保たれている。
  • 攻撃はクライアント数とローカルデータセットサイズに比例してスケーリング可能であり、必要なモデルパラメータが線形に増加する一方で、非ゼロパラメータは一定のままである。
  • 微分プライバシーが適用されても LOKI は有効に機能するが、ノイズの注入によりモデルの精度が低下するため、プライバシーと有用性のトレードオフが顕在化する。
  • 攻撃はモデルの不整合や繰り返しイテレーションを必要とせず、反復的最適化やブラインドソース分離を一切必要とせず、1ラウンドで実行可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。