Skip to main content
QUICK REVIEW

[論文レビュー] Source Inference Attacks in Federated Learning

Hongsheng Hu, Zoran Salčić|arXiv (Cornell University)|Sep 13, 2021
Privacy-Preserving Technologies in Data参考文献 38被引用数 4
ひとこと要約

本稿はフェデレーテッドラーニングにおけるソースインファレンスアタック(SIAs)を提案する。誠実だが好奇心の強いサーバーが、局所モデルの予測損失を分析することで、特定の訓練例がどのクライアントから寄与されたかを推定する。この攻撃はFLプロトコルに違反せず、高い正確性(最高で75.1%のASR)を達成しており、ソースプライバシーがメンバーインファレンスを超えた重要なが見過ごされている脅威であることが明らかになった。

ABSTRACT

Federated learning (FL) has emerged as a promising privacy-aware paradigm that allows multiple clients to jointly train a model without sharing their private data. Recently, many studies have shown that FL is vulnerable to membership inference attacks (MIAs) that can distinguish the training members of the given model from the non-members. However, existing MIAs ignore the source of a training member, i.e., the information of which client owns the training member, while it is essential to explore source privacy in FL beyond membership privacy of examples from all clients. The leakage of source information can lead to severe privacy issues. For example, identification of the hospital contributing to the training of an FL model for COVID-19 pandemic can render the owner of a data record from this hospital more prone to discrimination if the hospital is in a high risk region. In this paper, we propose a new inference attack called source inference attack (SIA), which can derive an optimal estimation of the source of a training member. Specifically, we innovatively adopt the Bayesian perspective to demonstrate that an honest-but-curious server can launch an SIA to steal non-trivial source information of the training members without violating the FL protocol. The server leverages the prediction loss of local models on the training members to achieve the attack effectively and non-intrusively. We conduct extensive experiments on one synthetic and five real datasets to evaluate the key factors in an SIA, and the results show the efficacy of the proposed source inference attack.

研究の動機と目的

  • 既存のメンバーインファレンス攻撃を超えて、訓練例の寄与元であるクライアントを特定するというソースプライバシーという、フェデレーテッドラーニングのプライバシーにおけるギャップを埋めること。
  • FLプロトコルを変更せず、モデル性能を劣化させることなく、サーバーがソース情報を推定できることを示すこと。
  • 非i.i.d.データ分布やクライアント数の変動といった多様なFL設定下でのソースインファレンスの有効性を評価すること。
  • 微分プライバシーを防御策として用いる際の限界を検討し、モデルの有用性と攻撃抑制の間の顕著なトレードオフを明らかにすること。

提案手法

  • 攻撃はベイジアンアプローチから定式化され、局所モデルの予測損失に基づいて、データサンプルのソースの事後確率をモデル化する。
  • サーバーは、与えられた訓練例に対して各局所モデルの予測損失を計算し、それによって最も可能性の高い寄与クライアントを推定する。
  • この手法は非侵襲的であり、モデル更新や通信を変更しない。唯一、既存のFL通信パターンを利用する。
  • 攻撃は、1つの合成データセットと5つの実世界データセット(LocationおよびCIFAR-10を含む)を用いて、データスケイ(α)、クライアント数(K)、および局所エポック数(E)の変動を考慮して評価された。
  • 微分プライバシーを防御メカニズムとして適用し、プライバシーとモデル有用性のバランスを最適化するためのハイパーパrameterを調整した。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおけるサーバーは、プロトコルに違反せずに、特定の訓練例がどのクライアントから寄与されたかを推定できるか?
  • RQ2データの非i.i.d.分布およびモデルの一般化性能は、ソースインファレンス攻撃の成功にどのように影響するか?
  • RQ3クライアント数、局所トレーニングエポック数、およびデータスケイの影響は、ソースインファレンスの正確性にどのような影響を与えるか?
  • RQ4微分プライバシーは、モデル有用性を著しく低下させることなく、ソースインファレンス攻撃を効果的に防御できるか?

主な発見

  • 標準的なFL設定下で、Locationデータセットでは平均的攻撃成功率(ASR)が75.1%、CIFAR-10では55.2%を達成した。
  • 攻撃の成功は、局所モデルの一般化性能と局所データ分布の多様性と強く相関している。
  • データが極めて非i.i.d.(αが低い)場合、攻撃性能が向上し、データスケイがソース漏洩を助長することが示された。
  • 微分プライバシーを適用すると、LocationではASRが55.1%に低下し、CIFAR-10では24.4%に低下したが、それぞれテスト精度が71.2%から12.3%、68.3%から10.0%に著しく低下した。
  • 結果から、ヴァナラ微分プライバシーはSIAsの防御として効果がなく、モデル有用性の著しい低下が生じるため、より優れたプライバシー保護メカニズムの必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。