Skip to main content
QUICK REVIEW

[論文レビュー] AIM: An Adaptive and Iterative Mechanism for Differentially Private Synthetic Data

Ryan M. McKenna, Brett Mullins|arXiv (Cornell University)|Jan 29, 2022
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

AIMは、差分プライバシーの合成データを生成するための新しいワークロード適応型メカニズムであり、関連性、改善可能性、プライバシー予算のバランスを取る新しい品質スコアに基づいて、反復的で貪欲なマージナルクエリ選択を用いる。従来の手法よりも顕著に低い誤差を達成し、クエリ誤差に関する解析的・高確率の信頼区間を提供する。これにより、追加のプライバシーコストを負担せずに生成後にも精度を評価できる。

ABSTRACT

We propose AIM, a new algorithm for differentially private synthetic data generation. AIM is a workload-adaptive algorithm within the paradigm of algorithms that first selects a set of queries, then privately measures those queries, and finally generates synthetic data from the noisy measurements. It uses a set of innovative features to iteratively select the most useful measurements, reflecting both their relevance to the workload and their value in approximating the input data. We also provide analytic expressions to bound per-query error with high probability which can be used to construct confidence intervals and inform users about the accuracy of generated data. We show empirically that AIM consistently outperforms a wide variety of existing mechanisms across a variety of experimental settings.

研究の動機と目的

  • ユーザーワークロードに適合した正確な差分プライバシー合成データを生成するという、長年の課題に取り組むこと。
  • 従来のワークロードに配慮したメカニズムには、しばしばワークロードに依存しないベースラインと比較して性能が劣るという限界があるため、それを克服すること。
  • 合成クエリの回答に関する、行動可能なデータ依存型誤差推定値を提供し、信頼性と意思決定支援を可能にすること。
  • 反復的で段階的な改善を通じて、クエリを適応的に選択するメカニズムを設計し、差分プライバシー予算を尊重しながら有用性を向上させること。
  • 実用的で、信頼区間を伴う合成データ生成アプローチを提供し、実世界での展開を可能にすること。

提案手法

  • AIMは、選択-測定-生成のパラダイムに従い、ノイズの入った測定値からPrivate-PGMを用いて合成データを生成する。
  • 新しい低感度品質スコアに基づいて、反復的で貪欲な選択プロセスを用いて次のマージナルクエリを選定する。
  • 品質スコアには、ワークロードの関連性、期待される改善度、現在の推定品質、残りのプライバシー予算が組み込まれている。
  • 適応的ラウンド選択と各ラウンドごとの動的予算配分を用いて、有用性を最適化する。
  • 知的候補セットで初期化し、一貫性と正確性を保証するために後処理を適用する。
  • 中間のプライベート測定値を用いて、追加のプライバシーコストなしに、解析的・高確率の一方向信頼区間をクエリ誤差に対して導出する。

実験結果

リサーチクエスチョン

  • RQ1ワークロード適応型メカニズムは、従来のワークロードに依存しないおよびワークロードに配慮した合成データ生成手法と比較して、クエリの正確性において顕著に優れているか?
  • RQ2データ依存型で後処理を施すメカニズムは、プライバシーを損なわせることなく、合成クエリ回答の信頼性の高い高確率誤差区間を提供できるか?
  • RQ3ワークロード関連性、期待される改善度、プライバシー予算配分の統合は、合成データの有用性にどのように影響するか?
  • RQ4反復的で貪欲なクエリ選択戦略は、固定または非適応的選択手法と比較して、どれほど誤差を低減するか?
  • RQ5提案された信頼区間は、特に実世界の展開において、合成データの不正確さをユーザーが検出・理解するのを支援できるか?

主な発見

  • AIMは、多様な実験設定とワークロードにおいて、MWEM+PGM、RAP、GEMを含む幅広い既存メカニズムを一貫して上回る。
  • 提案された品質スコアにより、より効果的なクエリ選択が可能となり、従来の適応的手法よりも合成データ生成の誤差が低減された。
  • AIMは、実際の入力データ上で実行された結果を反映する、解析的・高確率の一方向信頼区間をクエリ誤差に対して提供し、ユーザーが行動可能な精度推定値を得られる。
  • 信頼区間は、既存のプライベート測定値のみを用いて事後的に計算され、追加のプライバシーコストを発生させない。
  • 実験的結果から、AIMは混合データ型や非線形目的関数を伴う複雑なワークロードに対しても優れた有用性を示した。
  • 本手法はデータ離散化に対して頑健であり、公開データを統合できるように拡張可能であり、有用性向上の新たな道筋を開く。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。