Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Query Release Through Adaptive Projection

Sergül Aydöre, William F. Brown|arXiv (Cornell University)|Mar 11, 2021
Privacy-Preserving Technologies in Data参考文献 36被引用数 11
ひとこと要約

本論文は、適応的で連続的緩和を用いた射影機構の微分プライバシー的アルゴリズムを提案し、多数の統計的クエリに対する回答をリリースする。勾配ベース最適化と高誤差クエリに基づく反復的精錬を可能にすることで、特に高プライバシーおよび高ワークロード環境下で、先行手法よりも顕著に低い最大誤差を達成する。

ABSTRACT

We propose, implement, and evaluate a new algorithm for releasing answers to very large numbers of statistical queries like $k$-way marginals, subject to differential privacy. Our algorithm makes adaptive use of a continuous relaxation of the Projection Mechanism, which answers queries on the private dataset using simple perturbation, and then attempts to find the synthetic dataset that most closely matches the noisy answers. We use a continuous relaxation of the synthetic dataset domain which makes the projection loss differentiable, and allows us to use efficient ML optimization techniques and tooling. Rather than answering all queries up front, we make judicious use of our privacy budget by iteratively and adaptively finding queries for which our (relaxed) synthetic data has high error, and then repeating the projection. We perform extensive experimental evaluations across a range of parameters and datasets, and find that our method outperforms existing algorithms in many cases, especially when the privacy budget is small or the query class is large.

研究の動機と目的

  • 微分プライバシーの下で多数の統計的クエリに対する回答を正確にリリースする課題に対処すること。
  • 合成データ生成における離散的プロジェクションの計算的非実行可能性を克服しつつ、プライバシー保証を維持すること。
  • 既存手法が失敗する高プライバシーおよび高ワークロード環境下での精度向上。
  • ディープラーニングツールキットを活用した効率的かつ拡張可能な、多様なクエリクラスへの展開。
  • 適応的・反復的クエリ選択と連続的緩和の組み合わせが、非適応的または離散的手法に比べて優れた実用性をもたらすことを示すこと。

提案手法

  • 合成データドメインの連続的緩和により、プロジェクション損失を微分可能とし、一次最適化手法の適用を可能にする。
  • 反復的・適応的クエリ選択を適用:各ラウンド後に高誤差クエリを特定し、それらにのみ応答することでプライバシー予算を効率的に消費する。
  • 勾配ベース最適化を用いて、ノイズ付きクエリ回答と合成データ回答の間のL2距離を最小化する微分可能プロジェクションステップを実装。
  • ランダム化ラウンディングを適用して、緩和された連続的合成データセットを元のスキーマにおける有効な離散的データセットに変換。
  • ディープラーニングフレームワークの自動微分およびGPUアクセcelerationを活用し、大規模なクエリセットへの効率的スケーリングを実現。
  • アルゴリズムは拡張可能:新しいクエリクラスをサポートするには、最適化パイプラインの再設計ではなく、クエリ評価関数の実装のみが必要。

実験結果

リサーチクエスチョン

  • RQ1プロジェクション機構の連続的緩和は、プライバシーを損なわずに微分プライバシークエリリリースにおける精度を向上させることができるか?
  • RQ2適応的・反復的クエリ選択は、一度にすべてのクエリに回答するのと比較して、プライバシー予算のより効果的な使用を可能にするか?
  • RQ3プライバシー予算とクエリワークロードの変動に応じて、本手法の精度および実行時間はどのようにスケーリングするか?
  • RQ4明示的に回答された少数のクエリからの一般化は、未観測のクエリに対するパフォーマンス向上にどの程度寄与するか?
  • RQ5本手法は、アーキテクチャの変更なしに、新しいクエリクラスに容易に拡張可能か?

主な発見

  • RAPは、テストされたすべてのプライバシー予算とクエリ数においてFEMを著しく上回り、特に高プライバシー(低ε)および高ワークロード環境下で顕著な優位性を示す。
  • Adultデータセットにおける3方向マージナルに関して、RAPは、後者にハードコードされた最適化を施したHDMM+LLSおよびHDMM+PGMよりも、小規模ワークロード環境下で低い最大誤差を達成している。
  • ε = 0.1の場合、RAPは3方向および5方向マージナルの数が64に増加しても、一貫して低最大誤差を維持しており、FEMを常に上回る。
  • 5倍のオーバーサンプリングを伴うランダム化ラウンディングは、緩和された合成データセットと比較して誤差をわずかに減少にとどめるため、忠実度の保持が強い。
  • 最適な合成データセットサイズn′は約1000〜2000であり、それ以上になると最適化の不安定性により誤差が増加する。
  • n′が小さいと実行時間が短縮されるが、n′が小さすぎると性能が劣化するため、効率性と精度のトレードオフが生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。