Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Attribute Reconstruction Attack in Federated Learning

Lingjuan Lyu, Chen Chen|arXiv (Cornell University)|Aug 16, 2021
Privacy-Preserving Technologies in Data参考文献 15被引用数 13
ひとこと要約

本稿は、フェデレーテッドラーニングにおける悪意あるサーバーが、エポック平均勾配から機微な属性を再構築する、新たな属性再構築攻撃(ARA)を提案する。従来の小バッチ勾配を用いる攻撃よりも現実的である。cos-matchingと呼ばれる、コサイン類似度を用いた勾配マッチング手法を提案し、未知の事前分布や欠損ラベルを含むさまざまな脅威モデルにおいて、実世界のデータセットで最先端の性能を達成する。

ABSTRACT

Federated learning (FL) emerged as a promising learning paradigm to enable a multitude of participants to construct a joint ML model without exposing their private training data. Existing FL designs have been shown to exhibit vulnerabilities which can be exploited by adversaries both within and outside of the system to compromise data privacy. However, most current works conduct attacks by leveraging gradients on a small batch of data, which is less practical in FL. In this work, we consider a more practical and interesting scenario in which participants share their epoch-averaged gradients (share gradients after at least 1 epoch of local training) rather than per-example or small batch-averaged gradients as in previous works. We perform the first systematic evaluation of attribute reconstruction attack (ARA) launched by the malicious server in the FL system, and empirically demonstrate that the shared epoch-averaged local model gradients can reveal sensitive attributes of local training data of any victim participant. To achieve this goal, we develop a more effective and efficient gradient matching based method called cos-matching to reconstruct the training data attributes. We evaluate our attacks on a variety of real-world datasets, scenarios, assumptions. Our experiments show that our proposed method achieves better attribute attack performance than most existing baselines.

研究の動機と目的

  • フェデレーテッドラーニングにおけるエポック平均勾長が、機微な属性を漏洩させる可能性があるかどうかを調査し、実用的でない脅威モデルのギャップを埋める。
  • 特にフルエポックトレーニングを想定した現実的なFL設定において、従来の勾長ベース攻撃よりもより効率的かつ効果的な手法を開発すること。
  • 既知/未知の事前分布、所属関係、真のラベルのレベルに応じた、攻撃者知識の異なる状況でのARAの体系的評価。
  • 攻撃者が完全なデータやラベル情報を欠いていても、機微な属性を高い精度で再構築できることを示すこと。
  • 勾長共有における脆弱性を露呈させることで、プライバシー保護型フェデレーテッドラーニングシステムの設計に役立つ知見を提供すること。

提案手法

  • 被害者の真の勾長更新と仮想勾長更新の間のコサイン類似度を用いる、cos-matchingと呼ばれる勾長マッチング手法を提案。この手法により再構築をガイドする。
  • 反復的最適化を用いて、仮想勾長と真の勾長の間の角度距離を最小化し、正確な属性推定を実現する。
  • 複数の脅威モデルをサポート:既知/未知の事前分布、既知/未知の所属関係、既知/未知の真のラベル。
  • 真のラベルが不明な場合に、仮想属性およびラベル最適化を統合し、エンドツーエンドの属性回復を可能にする。
  • 実世界のデータセット(例:Location, Purchase, Genome)を用い、多様な仮定下での性能を評価する。
  • 時間的整合性を活用するため、複数ラウンドの勾長観測戦略を適用し、再構築の忠実度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1悪意あるサーバーは、小バッチ勾長へのアクセスがなくても、フェデレーテッドラーニングにおけるエポック平均勾長から機微な属性を再構築できるか?
  • RQ2攻撃者の事前知識(例:事前分布、所属関係、真のラベル)のレベルが異なる場合、属性再構築の性能はどのように変化するか?
  • RQ3cos-matchingは、現実的なFL設定において、既存の勾長ベース再構築手法よりも効果的かつ効率的か?
  • RQ4事前分布が未知またはラベルが利用できない場合、攻撃性能はどの程度低下するか?
  • RQ5ローカルバッチサイズおよびデータ分布の影響は、属性再構築の成功にどのように及ぶか?

主な発見

  • Locationデータセットでは、事前分布が未知の状態でB=|Dv|の条件下で、cos-matchingが第1属性に対して94.00%の再構築精度を達成し、ベースラインを上回った。
  • Purchase100データセットでは、|Dv|=500かつB=|Dv|の条件下で、第130番目の属性に対して94.00%の精度を達成。Nasrら(2019)のベースライン73.4%を著しく上回った。
  • 真のラベルが不明であったが事前分布が既知の状態では、Purchase2およびGenomeデータセットの両方でラベル再構築に100%の精度を達成した。
  • cos-matchingを用いた所属関係推定攻撃は、50件のサンプルに対して99.00%の精度を達成し、73.4%のベースラインを上回った。
  • 事前分布が未知でB=8の状態でも、Locationの第1属性に対して86.00%の精度を維持し、最小限の仮定下でも高いロバスト性を示した。
  • 事前分布およびラベル情報が欠落している状況を含め、すべての設定でベースライン(ランダム、public100、public1000、stats)を上回る一貫した高い攻撃性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。