Skip to main content
QUICK REVIEW

[論文レビュー] Deep Leakage from Model in Federated Learning

Zihao Zhao, Mengen Luo|arXiv (Cornell University)|Jun 10, 2022
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿は、勾配情報や補助パラメータを必要とせず、送信されたモデル重みと損失関数のみを用いて、フェデレーテッドラーニングにおけるプライベートなクライント学習データを回復する2つの新規な攻撃フレームワーク、Deep Leakage from Model (DLM) および DLM+ を提案する。これらの攻撃は、既存の勾配ベースの漏洩手法よりも高い精度を達成し、フェデレーテッドラーニングにおけるモデル重みの送信が、広く使われる FedAvg の設定ですらも安全でないことを示している。

ABSTRACT

Distributed machine learning has been widely used in recent years to tackle the large and complex dataset problem. Therewith, the security of distributed learning has also drawn increasing attentions from both academia and industry. In this context, federated learning (FL) was developed as a "secure" distributed learning by maintaining private training data locally and only public model gradients are communicated between. However, to date, a variety of gradient leakage attacks have been proposed for this procedure and prove that it is insecure. For instance, a common drawback of these attacks is shared: they require too much auxiliary information such as model weights, optimizers, and some hyperparameters (e.g., learning rate), which are difficult to obtain in real situations. Moreover, many existing algorithms avoid transmitting model gradients in FL and turn to sending model weights, such as FedAvg, but few people consider its security breach. In this paper, we present two novel frameworks to demonstrate that transmitting model weights is also likely to leak private local data of clients, i.e., (DLM and DLM+), under the FL scenario. In addition, a number of experiments are performed to illustrate the effect and generality of our attack frameworks. At the end of this paper, we also introduce two defenses to the proposed attacks and evaluate their protection effects. Comprehensively, the proposed attack and defense schemes can be applied to the general distributed learning scenario as well, just with some appropriate customization.

研究の動機と目的

  • モデル重みがフェデレーテッドラーニングで送信される場合、勾配よりも安全であると見なされるが、それでもクライアントのプライベートな学習データが漏洩する可能性があるかどうかを調査すること。
  • 勾配、最適化手法、ハイパーパramータを必要とせず、モデルパラメータと損失関数のみを用いて、プライベートな学習データを回復する新たな攻撃フレームワークを開発すること。
  • 非IIDデータや複数のローカルイテレーションを含む現実的なフェデレーテッドラーニング設定下での、提案攻撃の耐性を評価すること。
  • 実用的な防御策として、微分プライバシーとモデルスパース化を提案・評価し、フェデレーテッドラーニングにおけるモデルパラメータ漏洩に対する防御を検討すること。

提案手法

  • DLMでは、重みと損失関数の関係を活用することで、勾配を必要とせずにモデル重みからデータ再構成を可能にする新規な損失関数を提案する。
  • DLM+ は、洗練された最適化戦略と追加の正則化を導入することで、再構成の忠実度を向上させた DLM の拡張版である。
  • 標準的なフェデレーテッドラーニングアルゴリズムである FedAvg に両フレームワークを適用し、モデル重みのみが交換される現実世界の設定での実現可能性を示す。
  • 勾配を用いない最適化プロセスを採用し、損失関数を監視信号として用いて、観測されたモデル重みに一致するように逐次的に合成入力を生成する。
  • モデル重みを送信する前にクリッピングし、ガウス分布またはラプラス分布のノイズを追加することで微分プライバシーを実装し、その保護効果を評価する。
  • 低絶対値の重みをプルーニングすることでモデルスパース化を実施し、情報漏洩の低減を図り、攻撃に対する耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおいて、勾配や補助パラメータにアクセスできない状況下でも、モデル重みのみからプライベートな学習データを再構成できるか?
  • RQ2提案された DLM および DLM+ 攻撃の性能は、DLG やコサイン類似度法といった既存の勾配ベース漏洩攻撃と比べてどうか?
  • RQ3ローカル学習イテレーション数や最適化手法の選択が、モデルパラメータ漏洩攻撃の成功に与える影響は何か?
  • RQ4モデルパラメータ漏洩に対する有効な防御策は何か?また、十分な保護を確保するためのしきい値は何か?

主な発見

  • DLM および DLM+ は、既存の勾配漏洩攻撃よりも顕著に高い PSNR および SSIM 値を達成しており、MLP および LeNet の両アーキテクチャにおいて優れた再構成品質を示している。
  • 攻撃は非IIDデータ分布や複数のローカルイテレーション下でも効果を保ち続けることから、現実のフェデレーテッドラーニング設定において強い耐性を示している。
  • ガウスノイズ強度が 1e-4 の微分プライバシーは攻撃を著しく妨げる。より高いノイズレベル(例:>1e-4)では、正確なデータ回復が不可能になる。
  • スパース化率が 50% 以上の場合は漏洩が顕著に低減されるが、DLM+ は 1% スパース化でも弱い耐性を示し、防御効果が限定的であることが判明した。
  • モデル重みのスパース化率が 50% に達しても、攻撃は識別可能な学習データを成功裏に再構成できた。これは、重みベースのフェデレーテッドラーニングシステムの根本的な脆弱性を示している。
  • 本研究は、フェデレーテッドラーニングにおけるモデル重み送信が本質的に安全ではないことを明らかにした。これは、重み送信は勾配送信よりも安全であるという仮定に疑問を呈するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。