[論文レビュー] Plausible Deniability for Privacy-Preserving Data Synthesis
本論文は、ありそうな偽造(plausible deniability)に基づく、プライバシー保護型データ合成の新規フレームワークを提案する。合成レコードは、ユーティリティ最適化モデルを用いて生成され、複数の実レコードから生成可能であることを示すプライバシー検証に合格した場合にのみ公開される。本手法は、生成モデルとプライバシー強制を分離することで、プライバシー保護を実現しつつ、ユーティリティの損失なしに微分プライバシーを達成する。これにより、理論的保証が強く、高いデータユーティリティを実現する、並列化可能な効率的な合成が可能となる。
Releasing full data records is one of the most challenging problems in data privacy. On the one hand, many of the popular techniques such as data de-identification are problematic because of their dependence on the background knowledge of adversaries. On the other hand, rigorous methods such as the exponential mechanism for differential privacy are often computationally impractical to use for releasing high dimensional data or cannot preserve high utility of original data due to their extensive data perturbation. This paper presents a criterion called plausible deniability that provides a formal privacy guarantee, notably for releasing sensitive datasets: an output record can be released only if a certain amount of input records are indistinguishable, up to a privacy parameter. This notion does not depend on the background knowledge of an adversary. Also, it can efficiently be checked by privacy tests. We present mechanisms to generate synthetic datasets with similar statistical properties to the input data and the same format. We study this technique both theoretically and experimentally. A key theoretical result shows that, with proper randomization, the plausible deniability mechanism generates differentially private synthetic data. We demonstrate the efficiency of this generative technique on a large dataset; it is shown to preserve the utility of original data with respect to various statistical analysis and machine learning measures.
研究の動機と目的
- 高次元で完全なデータセットを公開する課題に、強力なプライバシー保証を維持しながら対処すること。
- 過剰なノイズを加えることでデータユーティリティが低下する既存の微分プライバシー手法の限界を克服すること。
- ユーティリティ最適化生成モデルとプライバシー強制を分離し、高ユーティリティな合成データを可能にすること。
- 合成レコードに対してありそうな偽造を保証するプライバシー検証を形式的かつ実装可能なものとして定式化すること。
- ありそうな偽造が、最小限のユーティリティコストで微分プライバシーを達成するために利用可能であることを示すこと。
提案手法
- フレームワークは、実データのシードから、汎用的でユーティリティ最適化された生成モデルを用いて合成データレコードを生成する。
- 各合成レコードに対して、それが複数の実レコードからありそうな生成物として得られるかどうかを確認するプライバシー検証が適用される。この検証は、プライバシーパラメータまで許容される。
- 検証に合格しなかった合成レコードは拒否され、入力レコードと出力レコードとの一意な対応関係が成立しないため、不正な識別が不可能になる。
- フレームワークは、数百万レコードの並列生成と検証を可能とし、従来の指数的メカニズムと比較して大幅に効率が向上する。
- 不正識別閾値をランダム化することで、微分プライバシーのメカニズムが証明され、ありそうな偽造と微分プライバシーの間の明確な関係が示された。
- 生成モデルとプライバシーの強制を分離することで、プライバシー設計を前提としない最新のモデルを、プライバシーを損なわず利用可能となる。
実験結果
リサーチクエスチョン
- RQ1ありそうな偽造を、合成データ生成のための強力で攻撃者に依存しないプライバシー保証として形式化できるか?
- RQ2高ユーティリティを維持しつつ、強力なプライバシーを保証するプライバシー保護型データ合成フレームワークを構築できるか?
- RQ3出力データを変更せずに、代わりに合成レコードのテストとフィルタリングを行うことで、微分プライバシーを達成できるか?
- RQ4ありそうな偽造は、大規模かつ高次元のデータセットにどの程度スケーラブルに適用できるか?
- RQ5合成データの文脈において、ありそうな偽造と微分プライバシーの関係は何か?
主な発見
- 提案されたフレームワークは、プライバシー検証を通じて、強力なプライバシー保証のもとで、効率的かつ並列化可能な合成データレコードの生成を可能にする。
- 従来の微分プライバシー手法とは異なり、生成モデルを変更しないことで、ユーティリティの劣化を回避する。
- ACSデータセットにおける合成は、指数的メカニズムが要求する2TBのメモリを回避する計算的に実行可能なものである。
- 不正識別閾値をランダム化することで、フレームワークが微分プライバシーを達成することが証明され、ありそうな偽造と微分プライバシーの間の形式的関係が示された。
- プライバシー検証により、公開された各合成レコードが複数の実レコードと区別不能であることが保証され、背景知識に依存しない強力なプライバシー保証が得られる。
- プライバシー検証に合格する限り、どのような高ユーティリティな生成モデルでも、プライバシーを損なわず利用可能となる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。