[论文解读] Tight and Robust Private Mean Estimation with Few Users
本文提出了一种高维数据下用户级差分隐私的新型私有均值估计机制,实现了用户数与每人样本数之间近乎最优的权衡——即使用户数少至 $ O(1/\varepsilon \log(1/\delta)) $ 亦可。该方法对高达 49% 的用户数据污染具有鲁棒性,并通过与维度无关的紧致均值估计界,提升了随机凸优化和梯度下降的私有学习效率。
In this work, we study high-dimensional mean estimation under user-level differential privacy, and design an $(\varepsilon,δ)$-differentially private mechanism using as few users as possible. In particular, we provide a nearly optimal trade-off between the number of users and the number of samples per user required for private mean estimation, even when the number of users is as low as $O(\frac{1}{\varepsilon}\log\frac{1}δ)$. Interestingly, this bound on the number of \emph{users} is independent of the dimension (though the number of \emph{samples per user} is allowed to depend polynomially on the dimension), unlike the previous work that requires the number of users to depend polynomially on the dimension. This resolves a problem first proposed by Amin et al. Moreover, our mechanism is robust against corruptions in up to $49\%$ of the users. Finally, our results also apply to optimal algorithms for privately learning discrete distributions with few users, answering a question of Liu et al., and a broader range of problems such as stochastic convex optimization and a variant of stochastic gradient descent via a reduction to differentially private mean estimation.
研究动机与目标
- 解决在用户数较少时,用户级差分隐私下私有均值估计的挑战,尤其关注用户数极少的情形。
- 在准确均值估计的前提下,实现用户数与每人样本数之间近乎最优的权衡。
- 确保对高达 49% 用户数据污染的鲁棒性,提升实际可靠性。
- 通过向私有均值估计的约化,将结果扩展至离散分布的私有学习以及随机凸优化。
提出的方法
- 提出一种适用于高维均值估计的新差分私有机制,该机制在用户级隐私下运行,每位用户贡献多个样本。
- 设计一种鲁棒估计程序,即使高达 49% 的用户数据被污染或相关联,仍能保持准确性。
- 采用与维度无关的分析框架,表明所需用户数的规模为 $ O(1/\varepsilon \log(1/\delta)) $,与数据维度 $ d $ 无关。
- 利用从私有随机凸优化和投影随机梯度下降到私有均值估计的约化,实现更紧致的隐私与准确度界。
- 应用强组合定理与噪声校准技术,确保在多次迭代中保持 $ (\varepsilon,\delta) $-差分隐私。
- 提出一种新颖的均值估计误差分析,其与维度呈多项式依赖,但仅与 $ \delta $ 呈对数依赖,从而实现低用户场景下的可扩展性。
实验结果
研究问题
- RQ1在用户级差分隐私下,实现准确私有均值估计所需的最少用户数是多少?
- RQ2是否可以使私有均值估计对用户中恒定比例的数据污染具有鲁棒性?
- RQ3在私有均值估计中,所需用户数是否会随数据维度增长?能否实现与维度无关?
- RQ4如何利用私有均值估计来改进低用户场景下私有的随机凸优化与梯度下降?
主要发现
- 所提机制仅需 $ O(1/\varepsilon \log(1/\delta)) $ 个用户即可实现 $ (\varepsilon,\delta) $-差分隐私,且与数据维度 $ d $ 无关,解决了 Amin 等人提出的一个开放问题。
- 即使高达 49% 的用户数据被污染或相关联,该方法仍保持估计准确性和隐私保证。
- 在离散分布的私有学习中,该机制提供了最优样本复杂度,回答了 Liu 等人提出的问题。
- 改进的均值估计框架将私有随机凸优化所需用户数从 $ \tilde{\Omega}(\sqrt{dT}/\varepsilon) $ 降低至 $ \tilde{\Omega}(\sqrt{T}/\varepsilon) $,消除了对 $ d $ 的显式依赖。
- 对于投影随机梯度下降,误差界被改进为 $ \tilde{O}\left(\frac{R^{2}H}{T}+R\sigma\cdot\frac{d}{n\sqrt{m}\cdot\varepsilon}\right) $,且用户数不再依赖于 $ d $。
- 该框架在随机凸优化中实现了更紧致的隐私-准确度权衡,所需用户数的规模为 $ \tilde{\Omega}(\varepsilon^{-1} + \min(\sqrt[3]{mH^{2}R^{2}/(G\underline{G}\cdot\varepsilon^{4})}, HR\sqrt{m}/(d\sigma\sqrt{\varepsilon}))) $,显著优于先前的界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。