Skip to main content
QUICK REVIEW

[论文解读] Private Mean Estimation of Heavy-Tailed Distributions

Gautam Kamath, Vikrant Singhal|arXiv (Cornell University)|Feb 21, 2020
Privacy-Preserving Technologies in Data参考文献 52被引用 15
一句话总结

该论文为具有有界k阶矩的单变量和多变量分布的差分隐私均值估计建立了紧致的样本复杂度界限,表明与次高斯分布相比,重尾分布的隐私成本显著更高。对于具有有界k阶矩的单变量分布,最优样本复杂度为Θ(1/α² + 1/(εα^{k/(k−1)}) + log(R)/ε),其对矩参数k的依赖关系在隐私设置下与非隐私设置下有质的不同。

ABSTRACT

We give new upper and lower bounds on the minimax sample complexity of differentially private mean estimation of distributions with bounded $k$-th moments. Roughly speaking, in the univariate case, we show that $n = Θ\left(\frac{1}{α^2} + \frac{1}{α^{\frac{k}{k-1}}\varepsilon} ight)$ samples are necessary and sufficient to estimate the mean to $α$-accuracy under $\varepsilon$-differential privacy, or any of its common relaxations. This result demonstrates a qualitatively different behavior compared to estimation absent privacy constraints, for which the sample complexity is identical for all $k \geq 2$. We also give algorithms for the multivariate setting whose sample complexity is a factor of $O(d)$ larger than the univariate case.

研究动机与目标

  • 确定在有界k阶矩假设下,差分隐私均值估计的极小极大样本复杂度。
  • 刻画均值估计的隐私成本如何依赖于底层分布的尾部行为,特别是重尾分布(k ≥ 2)的情形。
  • 将分析从单变量推广至多变量分布,建立高维情况下的样本复杂度界限。
  • 在相同的矩约束下,为纯差分隐私、zCDP和近似DP变体提供紧致的上下界。

提出的方法

  • 提出一种私有均值估计算法:首先利用私有直方图机制估计分布的范围,然后在估计的范围内对经验均值应用加噪机制。
  • 通过精心校准的噪声使用拉普拉斯机制实现私有范围估计,以确保差分隐私的同时保持准确性。
  • 应用截断经验均值估计器,并将噪声校准至k阶矩和隐私参数ε,利用对称化和矩界技术。
  • 基于总变差距离和相对距离为1/4的码,采用打包论证法推导高维设置下的下界。
  • 将分析适应于多种隐私定义(纯ε-DP、zCDP、近似(ε,δ)-DP),表明在所有变体中,样本复杂度对α和ε的依赖关系在渐近意义上均为紧致。
  • 使用变量替换论证,将结果从k阶矩≤1的归一化分布推广至k阶矩有界于M^kσ^k的一般分布。

实验结果

研究问题

  • RQ1当底层分布具有有界k阶矩(k ≥ 2)时,差分隐私均值估计的最优样本复杂度是多少?
  • RQ2与次高斯分布(k = 2)相比,重尾分布(k > 2)的均值估计隐私成本有何不同?
  • RQ3在相同的矩约束下,能否为纯差分隐私和宽松差分隐私变体建立紧致的上下界?
  • RQ4在多变量情况下,样本复杂度如何随维度d变化?其对隐私参数和精度的依赖关系如何?

主要发现

  • 对于具有有界k阶矩的单变量分布,ε-差分隐私下的最优样本复杂度为Θ(1/α² + 1/(εα^{k/(k−1)}) + log(R)/ε),其中R为均值的上界。
  • 样本复杂度对k值高度敏感,随着k增大,隐私成本显著上升,这与非隐私情形下对所有k ≥ 2均为O(1/α²)的复杂度行为有本质不同。
  • 对于所有方向上具有有界二阶矩的多变量分布,样本复杂度为Ω(d/α²ε),相较于单变量情形呈d倍增长。
  • 为三种常见差分隐私变体(纯ε-DP、zCDP、近似(ε,δ)-DP)均建立了紧致界限,其中主项1/α² + 1/(εα^{k/(k−1)})在所有变体中保持一致。
  • 高维均值估计的下界表明,任何(ε,0)-DP算法若要求ℓ₂²误差小于α²/192,则必须使用Ω(d/α²ε)个样本,从而证明了多变量设置中d因子的最优性。
  • 通过基于已知方差和k阶矩边界的缩放,分析可推广至归一化误差情形,表明样本复杂度按O(M^{k/(k−1)}/(εα^{k/(k−1)}) )缩放,适用于归一化误差α。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。