Skip to main content
QUICK REVIEW

[論文レビュー] The Inadequacy of Similarity-based Privacy Metrics: Privacy Attacks against "Truly Anonymous" Synthetic Datasets

Georgy Ganev, Emiliano De Cristofaro|arXiv (Cornell University)|Dec 8, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、合成データプロバイダーがプライバシー保護を主張するために使用する類似度ベースのプライバシー指標(SBPMs)に深刻な欠陥が存在することを暴露する。本研究では、生成モデルとプライバシー指標のみを用いて、低密度のトレーニングレコードの78%を回復できるブラックボックス再構築攻撃「ReconSyn」を提案する。これは、SBPMsが微分プライバシーまたは低効用のジェネレータと組み合わせて用いられても、プライバシーを確保できないことを示している。

ABSTRACT

Generative models producing synthetic data are meant to provide a privacy-friendly approach to releasing data. However, their privacy guarantees are only considered robust when models satisfy Differential Privacy (DP). Alas, this is not a ubiquitous standard, as many leading companies (and, in fact, research papers) use ad-hoc privacy metrics based on testing the statistical similarity between synthetic and real data. In this paper, we examine the privacy metrics used in real-world synthetic data deployments and demonstrate their unreliability in several ways. First, we provide counter-examples where severe privacy violations occur even if the privacy tests pass and instantiate accurate membership and attribute inference attacks with minimal cost. We then introduce ReconSyn, a reconstruction attack that generates multiple synthetic datasets that are considered private by the metrics but actually leak information unique to individual records. We show that ReconSyn recovers 78-100% of the outliers in the train data with only black-box access to a single fitted generative model and the privacy metrics. In the process, we show that applying DP only to the model does not mitigate this attack, as using privacy metrics breaks the end-to-end DP pipeline.

研究の動機と目的

  • 業界が合成データのプライバシーを実証的に保証するために使用する類似度ベースのプライバシー指標(SBPMs)の根本的な弱みを分析すること。
  • 標準的な評価基準を満たしても、SBPMsが誤ったプライバシー保証を提供することを示すこと。
  • 生成モデルとSBPMsのみを用いてトレーニングレコードを再構築できるブラックボックス再構築攻撃「ReconSyn」を提案すること。
  • 生成モデルに微分プライバシー(DP)を適用しても、未加工のヒューリスティクスと組み合わせるとReconSynが緩和されないことを示すこと。
  • SBPMsはGDPR適合性に不十分であり、プライバシーの主な保証として使用すべきではないと主張すること。

提案手法

  • ブラックボックスアクセスを前提とした再構築攻撃「ReconSyn」を設計する。具体的には、1つのトレーニング済み生成モデルとプライバシー指標へのアクセスを想定する。
  • SBPMsの構造を悪用する。繰り返し合成サンプルを生成し、同じ指標を用いてトレーニングレコードとの類似度を測定する。
  • 生成モデルがうまくシミュレートしにくい inherently な外れ値(低密度トレーニングレコード)を標的とし、再構築に脆弱であることを活かす。
  • SBPMsから得られる統計的距離のしきい値を用い、合成サンプルに近すぎるレコードを特定する。これは、メモリゼーションの兆候を示している可能性がある。
  • 多様なデータセット(Adult、Census、MNIST)において、最先端のテーブル生成モデル(PrivBayes、MST、DPGAN、PATE-GAN、CTGAN)に攻撃を適用する。
  • 生成モデルが低効用(例:Random、Independent)であっても攻撃が有効であることを示し、漏洩の主な原因がモデルではなく指標であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1類似度ベースのプライバシー指標は、合成データにおけるプライバシー漏洩を信頼性を持って検出・防止できるか?
  • RQ2標準的な評価基準を満たしても、SBPMsは低密度トレーニングレコード(外れ値)をどれほど不十分に保護しているのか?
  • RQ3ブラックボックス攻撃者が、生成モデルとSBPMsそのものへのアクセスのみでトレーニングデータを再構築できるか?
  • RQ4生成モデルに微分プライバシーを適用しても、SBPMsが引き続き使用される場合、再構築攻撃は緩和されるか?
  • RQ5SBPMsはGDPRなどのプライバシー規制に適合するのに十分か?

主な発見

  • ReconSynは、すべての評価設定において、低密度トレーニングレコード(外れ値)の少なくとも78%を、正確に完全な正確度で再構築に成功している。
  • 攻撃は、Random や Independent といった低効用ジェネレータに対しても効果を示しており、漏洩の主な原因が指標にあり、モデルではないことを証明している。
  • 生成モデルに微分プライバシーを適用しても、未加工のヒューリスティクスと組み合わせるとReconSynは回避できない。攻撃は指標そのものを直接狙っているためである。
  • 本研究では、広く使われているSBPMsに深刻な欠陥が存在することを特定した。反例を用いて、実際のデータ漏洩が発生しているにもかかわらずプライバシーテストが合格するという、一貫性や信頼性の欠如を示した。
  • SBPMsは十分なプライバシー保証を提供せず、GDPR適合性にも不十分である。これは、属性推定やメンバーシップ推定攻撃を防げないためである。
  • 攻撃は生成モデルの種別、データセット、用途に依存しない。これは、現在の合成データの実践における広範な適用可能性と構造的リスクを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。