Skip to main content
QUICK REVIEW

[論文レビュー] Hiding Among the Clones: A Simple and Nearly Optimal Analysis of Privacy Amplification by Shuffling

Vitaly Feldman, Audra McMillan|arXiv (Cornell University)|Dec 23, 2020
Privacy-Preserving Technologies in Data被引用数 13
ひとこと要約

本稿では、微分プライバシーのシャッフルモデルにおけるプライバシー強化の新たな簡素化された解析を提示する。これにより、適応的かつ${\varepsilon}_0$-微分プライベートな局所的ランダムライザーの系列が、$(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/\delta)/n}}, \delta)$-プライベートなアルゴリズムを実現することを示した。この手法は、${\varepsilon}_0$に漸近的に最適な依存関係を達成し、先行研究の境界を著しく改善し、3出力分布における発散解析により、よりきめ細かい数値境界を可能にする。

ABSTRACT

Recent work of Erlingsson, Feldman, Mironov, Raghunathan, Talwar, and Thakurta [EFMRTT19] demonstrates that random shuffling amplifies differential privacy guarantees of locally randomized data. Such amplification implies substantially stronger privacy guarantees for systems in which data is contributed anonymously [BEMMRLRKTS17] and has lead to significant interest in the shuffle model of privacy [CSUZZ19; EFMRTT19]. We show that random shuffling of $n$ data records that are input to $\varepsilon_0$-differentially private local randomizers results in an $(O((1-e^{-\varepsilon_0})\sqrt{\frac{e^{\varepsilon_0}\log(1/δ)}{n}}), δ)$-differentially private algorithm. This significantly improves over previous work and achieves the asymptotically optimal dependence in $\varepsilon_0$. Our result is based on a new approach that is simpler than previous work and extends to approximate differential privacy with nearly the same guarantees. Importantly, our work also yields an algorithm for deriving tighter bounds on the resulting $\varepsilon$ and $δ$ as well as Rényi differential privacy guarantees. We show numerically that our algorithm gets to within a small constant factor of the optimal bound. As a direct corollary of our analysis we derive a simple and nearly optimal algorithm for frequency estimation in the shuffle model of privacy. We also observe that our result implies the first asymptotically optimal privacy analysis of noisy stochastic gradient descent that applies to sampling without replacement.

研究の動機と目的

  • 先行のシャッフルによるプライバシー強化解析において、特に${\varepsilon}_0 > 1$のとき、局所的プライバシーパラメータ${\varepsilon}_0$に非最適な依存関係がある問題に対処する。
  • 先行研究が弱い保証しか与えなかった近似的に微分プライベートな局所的ランダムライザーへと解析を拡張する。
  • 先行の複雑な解析と比較して、より単純化された証明技法を提供し、より広範な適用可能性と容易な実装を可能にする。
  • リーマン発散を用いた数値的にきめ細かいプライバシー境界の計算を可能にする、効率的な手法を提供する。
  • シャッフルモデルにおける周波数推定のほぼ最適なアルゴリズムを導出し、ノイズを含む勾配降下法のプライバシー解析を改善する。

提案手法

  • 中心的な手法は、適応的局所アルゴリズムのプライバシー解析を、非適応的3出力局所ランダムライザーの解析に還元することである。ここでは「クローン」と呼ばれる、基準出力と統計的に区別できない出力の概念を活用する。
  • ${\varepsilon}_0 > 1$の場合、クローンの二項分布を用いてプライバシー損失を評価し、データポイントがランダムな数のクローンの間に隠れる必要があることを示す。
  • ${\varepsilon}_0$が小さい場合、2入力の任意の局所ランダムライザーが二値ランダムレスポンスと後処理に分解可能であることに着目し、よりきめ細かい境界を導出する。
  • 3出力における多項分布間のリーマン発散を分析することでプライバシー境界を計算し、数値的にきめ細かい境界を実現する。
  • この枠組みは近似的微分プライバシーおよびリーマン微分プライバシーへと拡張され、直接発散評価による数値計算が可能になる。
  • このアプローチは実装され、公開されたコードにより、最小限のオーバーヘッドでプライバシー強化境界の計算が可能になる。

実験結果

リサーチクエスチョン

  • RQ1シャッフルによるプライバシー強化を、${\varepsilon}_0$に漸近的に最適な依存関係を達成する、より単純な証明で解析可能か?
  • RQ2近似的に微分プライベートな局所ランダムライザーへと解析を拡張でき、より良い境界が得られるか?
  • RQ3既存の閉形式表現と比較して、よりきめ細かい数値的プライバシー境界を生成できるか?
  • RQ4このアプローチにより、シャッフルモデルにおける周波数推定でほぼ最適なアルゴリズムが得られるか?
  • RQ5この枠組みを用いて、ノイズを含む勾配降下法のような合成アルゴリズムのよりきめ細かいプライバシー保証を導出できるか?

主な発見

  • 本稿では、$(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/{\delta})/n}}, \delta)$-微分プライベートなアルゴリズムを達成し、${\varepsilon}_0 > 1$の領域では最適な$e^{{\varepsilon}_0/2}$依存関係と漸近的に一致する。
  • 近似的微分プライバシーにおいて、依存関係を$e^{20{\varepsilon}_0}$から$e^{{\varepsilon}_0/2}$に改善し、二値ランダムレスポンスの最良-known境界と一致する。
  • 3出力における発散解析により算出された数値境界は、最適境界の小さな定数倍の範囲内にあり、先行の最先端技術と比べて顕著に向上した。
  • 合成アルゴリズムのプライバシー保証をよりきめ細かくできる:高度な合成を組み合わせた場合、既存のRDPベースの手法と比較して、はるかに優れた近似的DP境界を達成する。
  • プライバシー強化境界の計算をシンプルかつ効率的に行うアルゴリズムを提供し、コードはhttps://github.com/apple/ml-shuffling-amplificationにて公開済み。
  • 解析は適応的および非適応的局所ランダムライザーに適用可能であり、リーマン微分プライバシーへと拡張可能で、数値結果はRDPのすべての順序でほぼ最適な性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。