Skip to main content
QUICK REVIEW

[論文レビュー] Anonymizing Data for Privacy-Preserving Federated Learning

Olivia Choudhury, Aris Gkoulalas-Divanis|arXiv (Cornell University)|Feb 21, 2020
Privacy-Preserving Technologies in Data参考文献 39被引用数 9
ひとこと要約

本論文は、フェデレーテッドラーニングにおける構文的匿名化手法を提案し、プライバシーを強化しながらモデルの有用性を最大化する。医療データセットにおいて、微分プライバシーを上回るF1スコアを達成する。ノイズベースの手法とは異なり、k-匿名性を用いて分散された複数のサイトにまたがる準個人識別子を一般化することで、解釈可能なプライバシー保証とともにGDPR/HIPAA準拠を実現する。

ABSTRACT

Federated learning enables training a global machine learning model from data distributed across multiple sites, without having to move the data. This is particularly relevant in healthcare applications, where data is rife with personal, highly-sensitive information, and data analysis methods must provably comply with regulatory guidelines. Although federated learning prevents sharing raw data, it is still possible to launch privacy attacks on the model parameters that are exposed during the training process, or on the generated machine learning model. In this paper, we propose the first syntactic approach for offering privacy in the context of federated learning. Unlike the state-of-the-art differential privacy-based frameworks, our approach aims to maximize utility or model performance, while supporting a defensible level of privacy, as demanded by GDPR and HIPAA. We perform a comprehensive empirical evaluation on two important problems in the healthcare domain, using real-world electronic health data of 1 million patients. The results demonstrate the effectiveness of our approach in achieving high model performance, while offering the desired level of privacy. Through comparative studies, we also show that, for varying datasets, experimental setups, and privacy budgets, our approach offers higher model performance than differential privacy-based techniques in federated learning.

研究の動機と目的

  • 微分プライバシーの限界を是正すること。特に、過剰なノイズによりモデルの有用性が著しく低下する問題に起因する。
  • GDPRおよびHIPAAと整合する、証明可能で解釈可能なプライバシー保証を備えたプライバシー保護型フェデレーテッドラーニングフレームワークを構築すること。
  • 生データを共有せずに、分散型の医療データ上で高パフォーマンスな機械学習を実現すること。
  • 複数のサイトにまたがるデータの有用性を保持しながら、k-匿名性を確保する分散型匿名化パイプラインを設計すること。
  • 同等のプライバシー予算下で、構文的匿名化が微分プライバシーを上回ることを実証的に検証すること。

提案手法

  • 本手法は、分散された複数のサイトにまたがる準個人識別子にk-匿名性を適用し、等価クラスに一般化することで、個人のアイデンティティを保護する。
  • 各サイトで特徴量の有用性とプライバシーへの影響を評価し、差別的特徴量を同定・匿名化する分散プロセスを導入する。
  • 属性の一般化方法を定義する構文的マッピングを抽出し、中央サーバーと共有することで一貫性を維持する。
  • 推論時、テストインスタンスはトレーニングデータから類似度が最も高い匿名化マッピングを用いて変換され、互換性を保証する。
  • 本手法は「匿名化してから分析する」パラダイムに従い、リレーショナルおよびトランザクショナルデータの両方を対象とする。
  • k値は3から50の範囲で使用され、kが大きいほどプライバシー保護が強化される。これは、北米およびカナダで確立された脱識別化実務に基づく。

実験結果

リサーチクエスチョン

  • RQ1構文的匿名化アプローチは、フェデレーテッドラーニングにおいて、微分プライバシーに比べてより強固で解釈可能なプライバシー保証を提供できるか?
  • RQ2実世界の医療データセットにおいて、構文的匿名化手法のモデル有用性は、微分プライバシーと比較してどのように異なるか?
  • RQ3k-匿名性パラメータを変化させた場合、分散型フェデレーテッドラーニング環境下でのモデル精度とプライバシーにどのような影響を与えるか?
  • RQ4複数のサイトにまたがる匿名化を、データの有用性やプライバシーを損なわず、効果的に調整できるか?
  • RQ5提案手法は、GDPRおよびHIPAA準拠を維持しつつ、高いモデルパフォーマンスを達成できるか、その程度はどの程度か?

主な発見

  • 提案された構文的匿名化手法は、全テストデータセットおよび分類アルゴリズムにおいて、微分プライバシーを上回るF1スコアを達成した。
  • kとεの同一レベルのプライバシー下で、構文的アプローチはε-微分プライバシーを一貫して上回るモデルの有用性を示した。特に、1000件未満のサイト環境(低サイト数)では顕著であった。
  • k=20の場合、適切な脱識別化水準を確保しながらも、高いモデルパフォーマンスを維持した。これは、HIPAAおよびGDPR準拠に適した防御可能な水準であった。
  • 本手法により、フェデレーテッドラーニングモデルは、生データを共有せずに中央集権学習と同等のパフォーマンスを達成した。
  • k値が高水準(最大50)であっても、依然として顕著なデータ有用性が維持された。これにより、スケーラビリティと耐障害性が示された。
  • 結果として、構文的匿名化は、特に有用性と規制準拠が重要な医療分野において、微分プライバシーの代替として実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。