Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Data -- Anonymisation Groundhog Day

Theresa Stadler, Bristena Oprisanu|arXiv (Cornell University)|Nov 13, 2020
Privacy-Preserving Technologies in Data参考文献 52被引用数 9
ひとこと要約

この論文は、合成データがプライバシー保護の万能薬であるという認識に疑問を呈し、従来の匿名化手法と比較して、プライバシーと有用性のトレードオフを定量的に評価している。合成データは推論攻撃に対して保護しないか、顕著なデータ有用性を犠牲にしており、プライバシー上の利益は予測不能で、実装に依存する。特に、微分プライバシーの保証下では顕著である。

ABSTRACT

Synthetic data has been advertised as a silver-bullet solution to privacy-preserving data publishing that addresses the shortcomings of traditional anonymisation techniques. The promise is that synthetic data drawn from generative models preserves the statistical properties of the original dataset but, at the same time, provides perfect protection against privacy attacks. In this work, we present the first quantitative evaluation of the privacy gain of synthetic data publishing and compare it to that of previous anonymisation techniques. Our evaluation of a wide range of state-of-the-art generative models demonstrates that synthetic data either does not prevent inference attacks or does not retain data utility. In other words, we empirically show that synthetic data does not provide a better tradeoff between privacy and utility than traditional anonymisation techniques. Furthermore, in contrast to traditional anonymisation, the privacy-utility tradeoff of synthetic data publishing is hard to predict. Because it is impossible to predict what signals a synthetic dataset will preserve and what information will be lost, synthetic data leads to a highly variable privacy gain and unpredictable utility loss. In summary, we find that synthetic data is far from the holy grail of privacy-preserving data publishing.

研究の動機と目的

  • 合成データが従来の匿名化技術よりも優れたプライバシーと有用性のトレードオフを提供するか、実証的に評価すること。
  • 人工的に生成されたデータであっても、合成データセットがリンク性攻撃および属性推論攻撃に対して脆弱であるかどうかを調査すること。
  • 合成データ公開に用いられる生成モデルにおける微分プライバシーの保証が、実際の運用で実際に守られているかを評価すること。
  • 実務家がさまざまなデータ公開手法の間でプライバシーと有用性を比較できるよう、評価フレームワークを開発し、オープンソース化すること。
  • 高次元データ共有に内在する根本的なプライバシーと有用性のトレードオフが、合成データによって解決されないことを示すこと。

提案手法

  • TexasおよびUCIデータセットを含む実世界のデータセットを用い、最先端の生成モデル(例:PrivBayes、GANs)を定量的に評価する。
  • 二つの新しい攻撃手法を採用:外れ値レコードを標的とするリンク性攻撃と、RiskMortalityなどの機微な属性に対する属性推論攻撃。
  • プライバシー利得(PG)と有用性優位性(AdvU)を測定し、合成データと従来の行レベルの洗練処理および微分プライバシー付きリリースとを比較する。
  • 生成モデルの内部構造を必要とせず、ブラックボックスアクセスを用いて、実世界の敵対的状況を模擬する。
  • 二つの微分プライバシー付き生成アルゴリズム(PrivBayesおよび類似手法)を再実装し、形式的なプライバシー保証に違反する実装上の欠陥を是正する。
  • 多様なデータ公開手法におけるプライバシーと有用性の再現可能なベンチマークを可能にするオープンソースの評価ライブラリを開発する。

実験結果

リサーチクエスチョン

  • RQ1合成データは、従来の行レベルの匿名化手法よりも優れたプライバシーと有用性のトレードオフを提供するか?
  • RQ2敵対者は、合成データセットのみを用いて、元のデータセットに特定の個人レコードが存在するかどうかをどの程度正確に推定できるか?
  • RQ3合成データ公開におけるプライバシー利得と有用性損失は、決定論的な洗練処理と比較してどの程度予測可能か?
  • RQ4既存の微分プライバシー付き生成モデルは、実際の運用で正式なプライバシー保証を実際に守っているか?
  • RQ5実装レベルの意思決定が、合成データのプライバシーと有用性にどのような影響を及ぼすか?

主な発見

  • 明示的なプライバシー保護を施さずに生成された合成データは、外れ値レコードをリンク性攻撃から保護できず、敵対者が標的レコードの存在を高い信頼性で推定できる。
  • 微分プライバシーを適用した合成データは、個々のレコードの信号を抑制することでプライバシー漏洩を低減するが、特にマイノリティのサブグループにおいて顕著な有用性損失を伴う。
  • 合成データにおけるプライバシーと有用性のトレードオフは予測不能である:どのデータ特徴が保持され、どの特徴が抑制されるかを事前に予測することは不可能である。
  • 広く使われている二つの微分プライバシー付き生成モデル(例:PrivBayes)における実装上の欠陥が、形式的なプライバシー保証に違反し、特定のレコードが推論攻撃に対して脆弱である。
  • 合成データが集計統計を保つ場合でも、クエリベースのプライバシー手法と比較してノイズが導入され、有用性が低下する。
  • 評価フレームワークの結果、高プライバシー性の合成データセットはしばしば有用性が低く、データ駆動型意思決定において偏りや誤った結論を導く可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。