Skip to main content
QUICK REVIEW

[論文レビュー] PrivLava: Synthesizing Relational Data with Foreign Keys under Differential Privacy

Kuntai Cai, Xiaokui Xiao|arXiv (Cornell University)|Apr 10, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

PrivLava は、潜在変数を用いたグラフィカルモデルを用いて、外部キーに起因する関係間相関を捉えることで、微分プライバシーのもとで、外部キーを備えた多関係型データベーステーブルの合成を初めて実現するフレームワークである。これは、任意の無閉路外部キースキーマをサポートし、CensusおよびTPC-Hデータセットにおける集計クエリにおいて、既存手法を上回る精度を達成する。

ABSTRACT

Answering database queries while preserving privacy is an important problem that has attracted considerable research attention in recent years. A canonical approach to this problem is to use synthetic data. That is, we replace the input database R with a synthetic database R* that preserves the characteristics of R, and use R* to answer queries. Existing solutions for relational data synthesis, however, either fail to provide strong privacy protection, or assume that R contains a single relation. In addition, it is challenging to extend the existing single-relation solutions to the case of multiple relations, because they are unable to model the complex correlations induced by the foreign keys. Therefore, multi-relational data synthesis with strong privacy guarantees is an open problem. In this paper, we address the above open problem by proposing PrivLava, the first solution for synthesizing relational data with foreign keys under differential privacy, a rigorous privacy framework widely adopted in both academia and industry. The key idea of PrivLava is to model the data distribution in R using graphical models, with latent variables included to capture the inter-relational correlations caused by foreign keys. We show that PrivLava supports arbitrary foreign key references that form a directed acyclic graph, and is able to tackle the common case when R contains a mixture of public and private relations. Extensive experiments on census data sets and the TPC-H benchmark demonstrate that PrivLava significantly outperforms its competitors in terms of the accuracy of aggregate queries processed on the synthetic data.

研究の動機と目的

  • 外部キーを備えた多関係型データベースにおける強力なプライバシー保護付き合成データ生成の欠如に対処すること。
  • 微分プライバシーのもとで、外部キー制約によって引き起こされる複雑な関係間相関をモデル化すること。
  • 1つのデータベーススキーマ内で公開関係とプライベート関係を併用することを可能にすること。
  • 合成データ上で集計クエリを正確に回答可能にすることと、きめ細やかなプライバシー保証を同時に確保すること。
  • 単関係型の微分プライバシー解決策を、外部キー参照整合性を保つ多関係型設定に拡張すること。

提案手法

  • PrivLava は、外部キーに起因する関係間依存を表すために、潜在変数を含むグラフィカルモデルを用いてデータ分布をモデル化する。
  • 合成プロセスを、関係間の結合分布の微分プライバシー保証付き推定問題として定式化し、外部キー制約を統合する。
  • フレームワークは、複数の関係にまたがる任意の有向無閉路グラフ(DAG)としての外部キー参照をサポートする。
  • グラフィカルモデルのパラメータに対して、ラプラスまたはガウスノイズを用いた微分プライバシー機構を用いて、プライバシー保護付きのパラメータ推定を統合する。
  • 一部の関係が公開で、他の関係がプライベートである混合スキーマを許容し、柔軟なデータ合成を可能にする。
  • 合成データは、学習済みの微分プライバシー保証付きグラフィカルモデルからのサンプリングによって生成される。

実験結果

リサーチクエスチョン

  • RQ1外部キーを備えた合成リレーショナルデータを、強力な微分プライバシー保証を維持したまま生成することは可能か?
  • RQ2外部キー制約によって引き起こされる複数関係間の複雑な相関関係を、プライバシー保護を前提としてどのようにモデル化できるか?
  • RQ3公開関係とプライベート関係を併用する混合スキーマを処理できるか?
  • RQ4微分プライバシーのもとで、合成データ上の集計クエリの精度は、既存手法と比べてどのように異なるか?
  • RQ5TPC-H やCensusデータのような実世界のデータベーススキーマにおいて、このアプローチはスケーラブルで効果的か?

主な発見

  • PrivLava は、CensusおよびTPC-Hベンチマークデータセットの両方において、既存のベースラインと比較して、集計クエリの精度が著しく高い。
  • フレームワークは、任意の無閉路外部キー関係をサポートし、複雑な多関係型スキーマのモデル化を可能にする。
  • 公開関係とプライベート関係の混合を効果的に処理でき、一部の関係が敏感でない場合でも、強力なプライバシー保証を維持する。
  • グラフィカルモデルにおける潜在変数の使用により、外部キーに起因する関係間依存関係を正確に捉えることができる。
  • 実験的評価により、PrivLava は微分プライバシーのもとで、最先端の単関係型および多関係型合成手法を上回るクエリ精度を達成することが示された。
  • 実際のデータベーススキーマにおいてもスケーラブルであり、攻撃者によるクエリワークロードに対してもプライバシーを維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。