Skip to main content
QUICK REVIEW

[論文レビュー] Gradient Disaggregation: Breaking Privacy in Federated Learning by Reconstructing the User Participant Matrix

Maximilian Lam, Gu-Yeon Wei|arXiv (Cornell University)|Jun 10, 2021
Privacy-Preserving Technologies in Data被引用数 11
ひとこと要約

本論文は、デバイス分析を介して収集されたサイドチャnel情報——特に参加頻度メトリクス——を活用することで、集約されたフェデレーテッドラーニングの更新から個々のユーザーのモデル更新を再構築する勾配分解攻撃を提案する。この手法はセキュアアグリゲーションのプライバシー保証をくつがえし、ノイズがかかるFedAvg更新でさえも、数千人のユーザーに対して高精度の推論攻撃を可能にする。

ABSTRACT

We show that aggregated model updates in federated learning may be insecure. An untrusted central server may disaggregate user updates from sums of updates across participants given repeated observations, enabling the server to recover privileged information about individual users' private training data via traditional gradient inference attacks. Our method revolves around reconstructing participant information (e.g: which rounds of training users participated in) from aggregated model updates by leveraging summary information from device analytics commonly used to monitor, debug, and manage federated learning systems. Our attack is parallelizable and we successfully disaggregate user updates on settings with up to thousands of participants. We quantitatively and qualitatively demonstrate significant improvements in the capability of various inference attacks on the disaggregated updates. Our attack enables the attribution of learned properties to individual users, violating anonymity, and shows that a determined central server may undermine the secure aggregation protocol to break individual users' data privacy in federated learning.

研究の動機と目的

  • 信頼できないサーバーがサイドチャネルとしてのデバイス分析データを収集する場合、フェデレーテッドラーニングにおけるセキュアアグリゲーションのプライバシー保証が侵害される可能性を示すこと。
  • 繰り返しの集約モデル更新の観測と参加頻度データを組み合わせることで、個々のユーザーのプライベートなモデル更新を再構築できるかどうかを調査すること。
  • 勾配分解が、勾配逆転やプロパティ推論といった従来の推論攻撃の成功率に与える影響を評価すること。
  • フェデレーテッドラーニングシステムにおいて要約されたデバイス分析データを収集するリスクを露呈すること。これはプライバシー漏洩のための隠れチャネルとして機能する可能性がある。

提案手法

  • 集約されたモデル更新とサイドチャネル分析データから、ユーザー参加行列を回復するために勾配分解を制約付き二値行列分解問題として定式化する。
  • 複数のトレーニングラウンドにわたる集約モデル更新の繰り返し観測を用いて、個々のユーザーの寄与を推定する。
  • 参加頻度などのデバイスレベルの分析データを活用して解空間を制約し、再構築の正確性を向上させる。
  • 正確な勾配とノイズが加わったFedAvg更新の両方に対して、実世界の条件でも有効であることを示すために、分解手法を適用する。
  • 回復された個々の更新を、標準的な推論攻撃(例:勾配逆転、プロパティ推論)の入力として用い、プライバシー漏洩の程度を評価する。
  • 最大数千人の参加者を含むデータセット上で手法を検証し、理想的な条件下でユーザー更新の正確な再構築を実現した。

実験結果

リサーチクエスチョン

  • RQ1信頼できない中央サーバーは、参加頻度メトリクスというサイドチャネル情報のみを用いて、集約更新から個々のユーザーのモデル更新を再構築できるか?
  • RQ2勾配分解は、勾配逆転やプロパティ推論といった既存の推論攻撃の性能をどの程度向上させるか?
  • RQ3FedAvgトレーニングが導入するノイズの存在下でも、勾配分解はどの程度有効か?
  • RQ4複数ラウンドにわたってデバイス参加頻度データにアクセスできるサーバーが存在する場合、セキュアアグリゲーションプロトコルは依然としてプライベートであるか?
  • RQ5フェデレーテッドラーニングシステムにおいてデバイス分析データを収集することは、プライバシーの観点からどのような実用的影響を及ぼすか?

主な発見

  • 提案された勾配分解攻撃は、最大数千人の参加者を想定した状況でも、理想的な条件下で正確な再構築を達成し、個々のユーザーのモデル更新を再構築することに成功した。
  • 勾配分解を適用した場合、100人のユーザーの更新を集約した状況で、勾配逆転攻撃のPSNRが18.6に達し、分解なしの13.3に比べて顕著に向上した。
  • プロパティ推論攻撃では、分解を適用した場合、ユーザー数の増加に伴ってAUCスコアが0.9以上を維持する一方、分解なしでは急速に低下した。
  • FedAvg更新を100人のユーザーから集約した状況でも、PSNR 18.6の高品質な画像再構築が可能であり、平均化によるノイズが効果的な分解を妨げないことを示した。
  • 分解により、集約された更新の下でも、個々のユーザーに対する推論攻撃が単一ユーザーを攻撃するのと同等の性能を達成できるようになった。
  • ノイズが加わった集約更新に対しても攻撃が有効であるため、FedAvgのような実世界のトレーニングダイナミクスに対しても、本手法は頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。