Skip to main content
QUICK REVIEW

[論文レビュー] Tight Lower Bounds for Differentially Private Selection

Thomas Steinke, Jonathan Ullman|arXiv (Cornell University)|Apr 10, 2017
Privacy-Preserving Technologies in Data参考文献 26被引用数 5
ひとこと要約

この論文は、d個の選択肢の中から上位k個のアイテムを微分プライバシーで選択するために必要な標本量の下界を、Ω(√k log d) として厳密に確立している。最小限の正確性要件のもとでも成立する。著者らは、従来のフィンガープrint法をスパース選択問題に拡張し、指数的メカニズムやスパースベクタ技法といった既存のアルゴリズムがより良い標本量を達成できないことを証明した。これにより、微分プライバシー分野における長年の未解決問題が解決された。

ABSTRACT

A pervasive task in the differential privacy literature is to select the $k$ items of "highest quality" out of a set of $d$ items, where the quality of each item depends on a sensitive dataset that must be protected. Variants of this task arise naturally in fundamental problems like feature selection and hypothesis testing, and also as subroutines for many sophisticated differentially private algorithms. The standard approaches to these tasks---repeated use of the exponential mechanism or the sparse vector technique---approximately solve this problem given a dataset of $n = O(\sqrt{k}\log d)$ samples. We provide a tight lower bound for some very simple variants of the private selection problem. Our lower bound shows that a sample of size $n = Ω(\sqrt{k} \log d)$ is required even to achieve a very minimal accuracy guarantee. Our results are based on an extension of the fingerprinting method to sparse selection problems. Previously, the fingerprinting method has been used to provide tight lower bounds for answering an entire set of $d$ queries, but often only some much smaller set of $k$ queries are relevant. Our extension allows us to prove lower bounds that depend on both the number of relevant queries and the total number of queries.

研究の動機と目的

  • d個の選択肢の中から上位k個のアイテムを微分プライバシーで選択するために必要な標本量のタイトな下界を確立すること。
  • 微分プライバシーにおける根本的な未解決問題に取り組むこと:上位k個の選択のための既存のアルゴリズムが、O(√k log d) の標本量を超えて改善可能かどうか。
  • 従来、すべてのd個のクエリに使用されてきたフィンガープリント法を、k個の関連クエリに限定されるスパース選択問題に拡張すること。
  • 指数的メカニズムやスパースベクタ技法といった標準的手法が達成するO(√k log d) の標本量が、漸近的に最適であることを証明すること。
  • 積分布と各選択座標の定数誤差を仮定した状況で問題を分析し、最小限の正確性でもこの標本量が必要であることを示すこと。

提案手法

  • 元来すべてのd個のクエリに対する下界で使われてきたフィンガープリント技法を、k個のクエリのみが関係するスパース選択問題に拡張する。
  • クエリ総数dと関連クエリ数kの両方を考慮する新しい分析フレームワークを導入する。
  • 正確に2k/dの割合の座標に対してp_j ≥ 7/8となる{0,1}^d上での積分布を用いて、選択問題の困難な分布を構築する。
  • 期待選択性能の2段階分析を実施:p_j ≤ 11/16 の座標とp_j > 11/16 の座標に分け、条件付き期待値を用いる。
  • 微分プライバシー制約を活用して、低平均座標の選択確率を制限し、出力選択子の期待ノルムの下界を導出する。
  • 集中不等式とプライバシー制約を組み合わせ、選択セットの期待効用に関する背理法を用いて、標本量の下界を導出する。

実験結果

リサーチクエスチョン

  • RQ1既存の微分プライバシー選択アルゴリズムにおけるO(√k log d) の標本量が最適であるか?
  • RQ2フィンガープリント法を、d個のクエリのうちk個のみが関連するスパース選択問題に適応可能か?
  • RQ3定数誤差/選択座標を満たすために、k個のアイテムを平均7/8以上で選択するのに必要な最小標本量は?
  • RQ4スパース選択設定において、標本量はdとkの両方に依存するか、それともdにのみ依存するか?
  • RQ5微分プライバシー(1, 1/nd)のもとで、o(√k log d) の標本数で定数誤差を達成できる異なるアルゴリズムは存在するか?

主な発見

  • この論文は、最小限の正確性要件のもとでも、微分プライバシー上位k個選択のためのタイトな下界Ω(√k log d) を証明した。
  • この下界は積分布に対して成立し、総誤差がk/10以下である任意の微分プライバシーアルゴリズムに適用可能である。
  • この結果により、指数的メカニズムやスパースベクタ技法といった既存のアルゴリズムが、標本量の観点で漸近的に最適であることが示された。
  • フィンガープリント法がスパース選択問題に成功裏に拡張され、dとkの両方に依存する下界を可能にした。
  • 分析により、定数誤差/選択座標と(1, 1/nd)-微分プライバシーのもとでも、Ω(√k log d) の標本数が必要であることが示された。
  • この下界はタイトであり、既存の最良の上界と一致しており、微分プライバシー分野における長年の未解決問題を解決した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。