Skip to main content
QUICK REVIEW

[論文レビュー] PrivSyn: Differentially Private Data Synthesis

Zhikun Zhang, Tianhao Wang|arXiv (Cornell University)|Dec 30, 2020
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

PrivSynは、グラフィカルモデルではなく、低次数のマージナルの大量セットを用いてデータ相関を捉える、新しい微分プライバシー付き合成データ生成フレームワークである。InDif指標を用いたプライベートで効率的なマージナル選択法と反復的合成アルゴリズムを導入し、最大100属性、2^500を超えるドメインサイズを有するテーブルデータセットにおいて高い有用性を達成し、NIST微分プライバシー合成データチャレンジにおいて先行手法を上回った。

ABSTRACT

In differential privacy (DP), a challenging problem is to generate synthetic datasets that efficiently capture the useful information in the private data. The synthetic dataset enables any task to be done without privacy concern and modification to existing algorithms. In this paper, we present PrivSyn, the first automatic synthetic data generation method that can handle general tabular datasets (with 100 attributes and domain size $>2^{500}$). PrivSyn is composed of a new method to automatically and privately identify correlations in the data, and a novel method to generate sample data from a dense graphic model. We extensively evaluate different methods on multiple datasets to demonstrate the performance of our method.

研究の動機と目的

  • 高次元テーブルデータに対する既存の微分プライバシー付き合成データ生成手法のスケーラビリティおよび有用性の制限を克服すること。
  • スパースなグラフィカルモデルに依存することで生じる制限的な条件付き独立仮定を回避すること。
  • 相互情報量のような高感度指標に依存せずに、情報量の多いマージナルを効率的かつプライベートに選択するための効率的でプライベートな手法を開発すること。
  • 追加のプライバシー費用を負担せずに、合成データの後処理を可能とし、任意の下流タスクをサポートすること。
  • 極めて大きなドメインサイズを有するデータセットに対しても、厳密なプライバシー予算のもとで高い有用性を達成すること。

提案手法

  • PrivSynは、データセットを低次数のマージナル(例:すべての1次元および約500個の2次元マージナル)の大量セットとして表現する。これらは本質的に低感度であるため、微分プライバシーに適している。
  • InDifを導入し、2変数間の相関を測定する低グローバル感度指標を提供することで、プライベートかつ効率的なマージナル選択を可能にする。
  • グリーディーなアルゴリズムがInDifスコアを用いて、有用性とプライバシーコストのバランスを取った情報量の多いマージナルペアを選択する。
  • マージナルのノイズを再現するように合成データセットを反復的に更新する反復的合成アルゴリズムを採用し、重複するマージナルの平均化による分散低減を施したMWEMフレームワークの変種を用いる。
  • 多くのマージナルにわたるノイズの増加を管理するため、高度な合成則またはゼロ集中微分プライバシー(zero-concentrated DP)を適用し、マージナル数に比例して線形にノイズが増加するように保証する。
  • 既存の分析パイプラインを変更せずに合成データ生成が可能であり、プライバシーはすべてデータ生成段階で消費されるため、後処理に追加のプライバシー費用がかからない。

実験結果

リサーチクエスチョン

  • RQ1パrametricなグラフィカルモデル手法と比較して、非パラメトリックでマージナルに基づくアプローチは、微分プライバシー付き合成データ生成において優れた性能を発揮できるか?
  • RQ2相互情報量のような高感度統計に依存せず、InDifのような低感度でプライベートな指標が、高次元データにおける有用な相関関係を効果的に同定できるか?
  • RQ3低次数のマージナルのみを用いても、強力なプライバシー保証と大規模ドメインサイズへのスケーラビリティを維持した高品質な合成データを生成することが可能か?
  • RQ4ノイズののったマージナルに基づく反復的合成プロセスは、既存手法と比較して有用性およびプライバシー-有用性のトレードオフにおいて優れているか?
  • RQ5100以上の属性と2^500を超えるドメインサイズを有するデータセットに対しても、実用的なパフォーマンスを維持しながらスケーリング可能か?

主な発見

  • PrivSynは、特に高次元設定において、PrivBayes や PGM などの既存手法と比較して優れた有用性を達成し、複数の実世界データセットで優れた性能を発揮した。
  • 本手法は、最大100属性および2^500を超えるドメインサイズを有するデータセットを効果的に処理でき、先行手法が困難とする分野でも成功した。
  • NIST微分プライバシー合成データチャレンジにおいて、PrivSynは他の手法を上回り、複雑で現実的である実世界データにおいて強力な実証的性能を示した。
  • InDifを用いたマージナル選択により、相互情報量に基づくアプローチの計算的ボトルネックを回避し、効率的かつプライベートに関連する相関関係を同定できた。
  • 反復的合成プロセスは、厳密なプライバシー予算のもとでも、ターゲットマージナルに非常に近い合成データセットに収束することが確認された。
  • フレームワークにより、合成データに対する任意の下流分析が追加のプライバシー費用を負担せずに可能となり、すべてのプライバシーがデータ生成段階で消費された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。