[論文レビュー] Faster Private Release of Marginals on Small Databases
本稿では、小さなデータベースに対してk方向マージンクエリに差別的プライバシーを保証するオンラインアルゴリズムを提示する。時間計算量が超指数的である。低重み入力におけるOR関数の近似に、有界なL1ノルムを持つ低次の多項式を用いることで、n ≳ d^0.51の条件下で、1クエリあたり±0.01の誤差で実行可能であり、これは多項式サイズのデータベースに対して、初めてのこのような効率的アルゴリズムである。
We study the problem of answering \emph{$k$-way marginal} queries on a database $D \in (\{0,1\}^d)^n$, while preserving differential privacy. The answer to a $k$-way marginal query is the fraction of the database's records $x \in \{0,1\}^d$ with a given value in each of a given set of up to $k$ columns. Marginal queries enable a rich class of statistical analyses on a dataset, and designing efficient algorithms for privately answering marginal queries has been identified as an important open problem in private data analysis. For any $k$, we give a differentially private online algorithm that runs in time $$ \min{\exp(d^{1-Ω(1/\sqrt{k})}), \exp(d / \log^{.99} d)\} $$ per query and answers any (possibly superpolynomially long and adaptively chosen) sequence of $k$-way marginal queries up to error at most $\pm .01$ on every query, provided $n \gtrsim d^{.51} $. To the best of our knowledge, this is the first algorithm capable of privately answering marginal queries with a non-trivial worst-case accuracy guarantee on a database of size $\poly(d, k)$ in time $\exp(o(d))$. Our algorithms are a variant of the private multiplicative weights algorithm (Hardt and Rothblum, FOCS '10), but using a different low-weight representation of the database. We derive our low-weight representation using approximations to the OR function by low-degree polynomials with coefficients of bounded $L_1$-norm. We also prove a strong limitation on our approach that is of independent approximation-theoretic interest. Specifically, we show that for any $k = o(\log d)$, any polynomial with coefficients of $L_1$-norm $poly(d)$ that pointwise approximates the $d$-variate OR function on all inputs of Hamming weight at most $k$ must have degree $d^{1-O(1/\sqrt{k})}$.
研究の動機と目的
- ポリノミアル(d,k)サイズのデータベースに対して、k方向マージンクエリに差別的プライバシーを保証する効率的アルゴリズムの設計。
- 従来のアルゴリズムが|D| ≳ |Q|^{1/2}を要するか、2^d時間で実行されるという制限を克服すること。
- ハミング重みが小さい入力におけるOR関数の低次数・低L1ノルム多項式近似を構築することで、小さなデータベースのプライベート分析を可能にすること。
- ハミング重みがk以下の入力に制限されたd変数OR関数を近似する多項式の次数とL1ノルムのタイトな境界を確立すること。
- 提案手法が、既存のプライベート乗法的重み法よりも高速な実行時間でありながら、最悪ケース誤差保証を維持できることを示すこと。
提案手法
- アルゴリズムは、有界なL1ノルム係数を持つ低次の多項式から導かれる、データベースの新しい近似多項式表現に、プライベート乗法的重み法を適用する。
- 次数d^{1−Ω(1/√k)}、L1ノルムd^{0.01}の多項式を構築し、ハミング重み≤kの入力におけるd変数OR関数を近似する。
- OR関数をネストされたORに分解し、チェビシェフ多項式を用いて外側のORを、有界な次数と係数重みで近似する。
- 多項式表現を用いることで、プライベート乗法的重み法フレームワークを適用し、データベースの圧縮された差別的プライベート要約として機能させることで、差別的プライバシーを保証する。
- 多項式の次数とL1ノルムのトレードオフを確立し、L1ノルムが多項式サイズのdの関数であるような近似において、k=o(log d)のとき、次数はd^{1−O(1/√k)}以上であることを示す。
- 多項式近似の精度が低下するにつれて、標準的なプライベート乗法的重み法に滑らかに劣化するため、後方互換性が保たれ、dが小さい場合でも実用的利点が得られる。
実験結果
リサーチクエスチョン
- RQ1サイズがpoly(d,k)のデータベースに対して、時間計算量がexp(o(d))であるような、k方向マージンクエリの差別的プライベート回答が可能か?
- RQ2ハミング重みがk以下の入力におけるd変数OR関数を近似する多項式の最小次数とL1ノルムは何か?
- RQ3このような近似多項式の次数とL1ノルムの間には根本的なトレードオフがあるか?その形は?
- RQ4データベースの低重み・低次数多項式表現を用いることで、プライベート乗法的重み法フレームワークを高速化できるか?
- RQ5多項式近似の使用により、小さなデータベースにおいて、超指数的時間計算量を達成するプライベートクエリ回答が可能か?
主な発見
- アルゴリズムは1クエリあたり時間計算量がpoly(n, exp(d^{1−Ω(1/√k)}))で実行され、n ≳ d^0.51の条件下で、任意のpoly(n)個のk方向マージンクエリ列に対して、誤差が±0.01以内である。
- ハミング重みが小さい入力におけるd変数OR関数の多項式近似を、次数d^{1−Ω(1/√k)}、L1ノルムd^{0.01}で構築し、大幅な効率性向上を達成した。
- 一致する下界により、k=o(log d)のとき、L1ノルムが多項式サイズのdの関数であるようなOR関数の近似は、次数がd^{1−O(1/√k)}以上である必要があることが示され、このアプローチが漸近的にタイトであることが証明された。
- 多項式サイズのデータベースに対して、時間計算量がexp(o(d))であるという、初めての結果であり、非自明な最悪ケース精度保証を有する。
- このアプローチは他の特徴空間へ一般化可能であるが、L1重み制約下では低次の単項式が最適であることが示されたため、設計がほぼ最適であると考えられる。
- フレームワークは、Nikolovら[NTZ13]の射影ベースプライベートクエリリリース法と互換性があり、2^{o(d)}個の頂点を持つ多面体による効率的な射影が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。