Skip to main content
QUICK REVIEW

[论文解读] Private and polynomial time algorithms for learning Gaussians and beyond

Hassan Ashtiani, Christopher Liaw|arXiv (Cornell University)|Nov 22, 2021
Machine Learning and Algorithms参考文献 34被引用 4
一句话总结

本文提出了一种通用框架,可将非私有的统计估计算法转换为差分隐私的多项式时间方法。该方法在 R^d 中实现了无限制高斯分布的最优样本复杂度,与目前已知的最佳理论界相比仅相差对数因子,并首次提供了样本复杂度为 Õ(d^{3.5}) 的高效私有鲁棒学习算法。

ABSTRACT

We present a fairly general framework for reducing $(\varepsilon, δ)$ differentially private (DP) statistical estimation to its non-private counterpart. As the main application of this framework, we give a polynomial time and $(\varepsilon,δ)$-DP algorithm for learning (unrestricted) Gaussian distributions in $\mathbb{R}^d$. The sample complexity of our approach for learning the Gaussian up to total variation distance $α$ is $\widetilde{O}(d^2/α^2 + d^2\sqrt{\ln(1/δ)}/α\varepsilon + d\ln(1/δ) / α\varepsilon)$ matching (up to logarithmic factors) the best known information-theoretic (non-efficient) sample complexity upper bound due to Aden-Ali, Ashtiani, and Kamath (ALT'21). In an independent work, Kamath, Mouzakis, Singhal, Steinke, and Ullman (arXiv:2111.04609) proved a similar result using a different approach and with $O(d^{5/2})$ sample complexity dependence on $d$. As another application of our framework, we provide the first polynomial time $(\varepsilon, δ)$-DP algorithm for robust learning of (unrestricted) Gaussians with sample complexity $\widetilde{O}(d^{3.5})$. In another independent work, Kothari, Manurangsi, and Velingker (arXiv:2112.03548) also provided a polynomial time $(\varepsilon, δ)$-DP algorithm for robust learning of Gaussians with sample complexity $\widetilde{O}(d^8)$.

研究动机与目标

  • 开发一种通用方法,将非私有的统计估计器转换为差分隐私的多项式时间算法。
  • 解决在 (ε,δ)-差分隐私下高效私有学习无限制多变量高斯分布的开放问题。
  • 提供首个多项式时间、差分隐私的算法,用于在部分样本被任意污染时鲁棒地学习高斯分布。
  • 在对数因子范围内匹配或几乎匹配目前已知的私有高斯学习信息论样本复杂度最优界。

提出的方法

  • 提出一种通用的约化技术,将任意非私有统计估计器转换为具有多项式运行时间的 (ε,δ)-差分隐私算法。
  • 将该框架应用于使用私有鲁棒均值估计器(QUEScoreFilter)结合噪声注入的掩蔽机制进行私有均值估计。
  • 采用基于私有假设选择方法并结合高斯分布局部小覆盖的私有协方差估计算法。
  • 结合私有均值与协方差估计,构建完整的多变量高斯分布私有学习算法。
  • 利用集中极限定理与隐私放大技术,确保在近似差分隐私下同时满足隐私与效用保障。
  • 采用两阶段方法:首先在隐私约束下鲁棒地估计均值,然后使用精心构造的覆盖集通过私有假设选择机制估计协方差。

实验结果

研究问题

  • RQ1能否设计一种通用框架,将非私有的统计估计器转换为差分隐私的多项式时间算法?
  • RQ2能否使用高效算法实现 R^d 中无限制高斯分布的最优样本复杂度私有学习?
  • RQ3当数据被污染时,能否在 (ε,δ)-差分隐私下高效实现高斯分布的私有鲁棒学习?
  • RQ4私有高效多变量高斯学习的最紧可实现样本复杂度是多少?能否在对数因子范围内匹配非私有界的最优值?

主要发现

  • 所提出的框架生成了 R^d 中无限制高斯分布的 (ε,δ)-DP 算法,样本复杂度为 Õ(d²/α² + d²√(ln(1/δ))/(αε) + d ln(1/δ)/(αε)),与目前已知的最佳非私有样本复杂度相比仅相差对数因子。
  • 该算法在 d、1/α、1/ε 和 log(1/δ) 上为多项式时间,实现了高维高斯分布的高效计算。
  • 首次实现了样本复杂度为 Õ(d^{3.5}) 的多项式时间、(ε,δ)-DP 鲁棒学习算法,显著优于先前工作中依赖于 Õ(d^8) 的结果。
  • 该框架实现了在 (2ε, 4e^εδ)-DP 下误差为 O(α√(log(1/α))) 的私有鲁棒均值估计,结合了私有鲁棒均值估计器与噪声注入。
  • 鲁棒协方差估计组件在相同隐私预算下实现了效用保障,构成了完整私有高斯学习流水线的核心。
  • 鲁棒学习算法的样本复杂度主要由协方差估计步骤主导,该步骤被识别为未来优化的潜在目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。