Skip to main content
QUICK REVIEW

[論文レビュー] Low-Rank Mechanism: Optimizing Batch Queries under Differential Privacy

Ganzhao Yuan, Zhenjie Zhang|arXiv (Cornell University)|Aug 1, 2012
Privacy-Preserving Technologies in Data参考文献 27被引用数 10
ひとこと要約

本稿では、ワークロード行列の低ランク近似を活用することで、バッチ線形カウントクエリを最適化する、新しい微分プライバシー準拠のクエリ処理技術であるLow-Rank Mechanism (LRM) を提案する。LRMは相関を意識したクエリ処理によりノイズを最小化することで、最先端の手法と比べて、しばしば1桁以上も高い精度を達成しており、微分プライバシー下でのバッチクエリワークロードにおける誤差の理論的下限に近づくことが証明されている。

ABSTRACT

Differential privacy is a promising privacy-preserving paradigm for statistical query processing over sensitive data. It works by injecting random noise into each query result, such that it is provably hard for the adversary to infer the presence or absence of any individual record from the published noisy results. The main objective in differentially private query processing is to maximize the accuracy of the query results, while satisfying the privacy guarantees. Previous work, notably the matrix mechanism, has suggested that processing a batch of correlated queries as a whole can potentially achieve considerable accuracy gains, compared to answering them individually. However, as we point out in this paper, the matrix mechanism is mainly of theoretical interest; in particular, several inherent problems in its design limit its accuracy in practice, which almost never exceeds that of naive methods. In fact, we are not aware of any existing solution that can effectively optimize a query batch under differential privacy. Motivated by this, we propose the Low-Rank Mechanism (LRM), the first practical differentially private technique for answering batch queries with high accuracy, based on a low rank approximation of the workload matrix. We prove that the accuracy provided by LRM is close to the theoretical lower bound for any mechanism to answer a batch of queries under differential privacy. Extensive experiments using real data demonstrate that LRM consistently outperforms state-of-the-art query processing solutions under differential privacy, by large margins.

研究の動機と目的

  • 微分プライバシー下でバッチクエリを最適化する、実用的で高精度な手法の不足を解消すること。
  • 理論的には有望であるが、実用的精度が低い既存のメカニズム(例:マトリックスメカニズム)の限界を克服すること。
  • クエリ間の相関を効果的に活用することで、ノイズの注入を最小限に抑えつつ、強力なプライバシー保証を維持する手法を開発すること。
  • 理論的誤差下限に近づく実用的でスケーラブルなソリューションを提供すること。これは、ǫ-微分プライバシー下でのバッチクエリ処理において有効である。

提案手法

  • LRMは、行列分解を用いてワークロード行列を低ランク近似としてモデル化し、W = CA の形に分解する。
  • フルなクエリ集合ではなく、低ランク成分(C と A)にラプラスメカニズムを適用することで、全体のノイズ分散を低減する。
  • 低ランク成分の感度に基づいて最適なノイズ分散を計算し、合計期待二乗誤差を最小化する。
  • 凸最適化技術を用いて、与えられたワークロードに対して期待誤差を最小化する最適な低ランク近似を計算する。
  • 低ランク構造によってグローバル感度を制限することで、ǫ-微分プライバシーを保証する。
  • LRMは効率的かつスケーラブルに設計されており、大規模なドメインや多数のクエリを含む実世界ワークロードに対しても実用的である。

実験結果

リサーチクエスチョン

  • RQ1バッチ線形クエリに対して、既存の手法を著しく上回る精度を達成する実用的で微分プライバシー準拠のメカニズムを設計できるか?
  • RQ2ワークロード行列の低ランク構造を活用することで、微分プライバシー下でノイズをどれほど低減でき、精度を向上させられるか?
  • RQ3クエリ数、ドメインサイズ、ワークロードランクが変化する際、LRMの性能は最先端のメカニズムと比較してどのようにスケーリングするか?
  • RQ4LRMの誤差は、バッチクエリを処理する任意の微分プライバシー準拠メカニズムの理論的下限に近づくか?
  • RQ5ワークロード行列の低ランク性は、LRMが達成する誤差低減にどのように影響するか?

主な発見

  • LRMは、大規模ワークロードにおいて、ラプラスメカニズム、マトリックスメカニズム、ワークロード最適メカニズムを平均二乗誤差の観点で2桁以上も上回っている。
  • 自然に低ランク構造を示すWRelatedワークロードでは、ドメインサイズが8192に達するに従い、LRMは2桁以上の性能向上を達成している。
  • ドメインサイズnに対してクエリ数mが小さい場合、WRangeおよびWRelatedワークロードにおいて、LRMは相関の有効活用により他の手法を著しく上回っている。
  • ワークロード行列のランクが上昇するにつれ、LRMの誤差は急激に増加し、その利点が直接的にクエリワークロードの低ランク性に依存していることが確認された。
  • LRMの性能はワークロード行列のランクに比例して線形にスケーリングされ、誤差最小化戦略の理論的基盤が裏付けられた。
  • すべてのテスト済みの実世界データセット(検索ログ、NetTrace、ソーシャルネットワーク)において、LRMはすべての構成およびプライバシー予算において、最小の平均二乗誤差を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。