[論文レビュー] Tight and Robust Private Mean Estimation with Few Users
本稿では、ユーザー単位のプライバシーを満たす高次元データにおける新しい微分プライバシー平均推定手法を提示する。この手法は、ユーザー数と1ユーザーあたりのサンプル数の間でほぼ最適なトレードオフを達成しており、たとえユーザー数が $ O(1/\varepsilon \log(1/\delta)) $ 個しかなくても問題ない。この手法は最大49%のユーザーのデータが損傷している場合でも耐性があり、次元に依存しないタイトな平均推定バウンドを用いて、確率的凸最適化および勾配降下法における改善されたプライベート学習を可能にする。
In this work, we study high-dimensional mean estimation under user-level differential privacy, and design an $(\varepsilon,δ)$-differentially private mechanism using as few users as possible. In particular, we provide a nearly optimal trade-off between the number of users and the number of samples per user required for private mean estimation, even when the number of users is as low as $O(\frac{1}{\varepsilon}\log\frac{1}δ)$. Interestingly, this bound on the number of \emph{users} is independent of the dimension (though the number of \emph{samples per user} is allowed to depend polynomially on the dimension), unlike the previous work that requires the number of users to depend polynomially on the dimension. This resolves a problem first proposed by Amin et al. Moreover, our mechanism is robust against corruptions in up to $49\%$ of the users. Finally, our results also apply to optimal algorithms for privately learning discrete distributions with few users, answering a question of Liu et al., and a broader range of problems such as stochastic convex optimization and a variant of stochastic gradient descent via a reduction to differentially private mean estimation.
研究の動機と目的
- ユーザー数が少ない状況下でのユーザー単位の微分プライバシーにおけるプライベート平均推定の挑戦に取り組むこと。
- 正確な平均推定を達成するための、ユーザー数と1ユーザーあたりのサンプル数の間のほぼ最適なトレードオフを達成すること。
- 最大49%のユーザーのデータにデータ損傷が生じても耐性を持つことにより、実用的な信頼性を高めること。
- プライベート平均推定への還元を用いて、離散分布のプライベート学習および確率的凸最適化への応用を拡張すること。
提案手法
- 各ユーザーが複数のサンプルを提供するユーザー単位のプライバシーを満たす高次元平均推定のための新しい微分プライバシー手法を提案する。
- 最大49%のユーザーのデータが損傷または相関している場合でも正確性を保つことができる耐障害性の高い推定手順を設計する。
- 次元に依存しない解析フレームワークを用いて、必要なユーザー数がデータ次元 $ d $ に依存せず、$ O(1/\varepsilon \log(1/\delta)) $ にスケーリングすることを示す。
- プライベート確率的凸最適化および投影勾配降下法をプライベート平均推定に還元することで、よりタイトなプライバシーと正確性のバウンドを実現する。
- 強い合成定理とノイズキャリブレーション技術を活用し、複数反復にわたって $ (\varepsilon,\delta) $-微分プライバシーを維持する。
- 次元に多項式的に依存するが $ \delta $ に対して対数的にしか依存しない平均推定の誤差に関する新しい解析を導入することで、低ユーザー環境におけるスケーラビリティを実現する。
実験結果
リサーチクエスチョン
- RQ1ユーザー単位の微分プライバシー下で、正確なプライベート平均推定を達成するために必要な最小ユーザー数は何か?
- RQ2プライベート平均推定を、一定割合のユーザーのデータ損傷に耐性を持たせることは可能か?
- RQ3プライベート平均推定において、必要なユーザー数はデータ次元に依存するのか、それとも次元に依存しないようにできるか?
- RQ4プライベート平均推定をどのようにして、低ユーザー環境下でのプライベート確率的凸最適化および勾配降下法の改善に応用できるか?
主な発見
- 提案手法は、データ次元 $ d $ に依存せず、$ O(1/\varepsilon \log(1/\delta)) $ 個のユーザーで $ (\varepsilon,\delta) $-微分プライバシーを達成し、Aminらによる未解決問題を解決する。
- 最大49%のユーザーのデータが損傷または相関している場合でも、推定の正確性とプライバシー保証を維持する。
- 離散分布のプライベート学習において、最適なサンプル複雑度を達成し、Liuらが提起した問いに答えを提示する。
- 改善された平均推定フレームワークにより、プライベート確率的凸最適化における必要なユーザー数を $ \tilde{\Omega}(\sqrt{dT}/\varepsilon) $ から $ \tilde{\Omega}(\sqrt{T}/\varepsilon) $ に削減し、明示的な $ d $ 依存性を排除する。
- 投影勾配降下法において、誤差バウンドが $ \tilde{O}\left(\frac{R^{2}H}{T}+R\sigma\cdot\frac{d}{n\sqrt{m}\cdot\varepsilon}\right) $ に改善され、ユーザー数が $ d $ に依存しなくなった。
- 確率的凸最適化におけるプライバシーと正確性のトレードオフがタイトに保たれ、必要なユーザー数が $ \tilde{\Omega}(\varepsilon^{-1} + \min(\sqrt[3]{mH^{2}R^{2}/(G\underline{G}\cdot\varepsilon^{4})}, HR\sqrt{m}/(d\sigma\sqrt{\varepsilon}))) $ にスケーリングされ、従来のバウンドを大幅に改善する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。