Skip to main content
QUICK REVIEW

[论文解读] The Cost of Privacy in Generalized Linear Models: Algorithms and Minimax Lower Bounds

Tianxi Cai, Yichen Wang|arXiv (Cornell University)|Nov 8, 2020
Privacy-Preserving Technologies in Data参考文献 51被引用 12
一句话总结

该论文提出了一种基于噪声投影梯度下降和迭代硬阈值法的广义线性模型(GLMs)参数估计的差分隐私算法。通过一种基于Stein引理的新技术,推导出隐私约束下的极小化极大下界,实现了近最优的统计性能,表明所提算法在样本量和维度上达到最优率,仅存在对数因子差异。

ABSTRACT

We propose differentially private algorithms for parameter estimation in both low-dimensional and high-dimensional sparse generalized linear models (GLMs) by constructing private versions of projected gradient descent. We show that the proposed algorithms are nearly rate-optimal by characterizing their statistical performance and establishing privacy-constrained minimax lower bounds for GLMs. The lower bounds are obtained via a novel technique, which is based on Stein's Lemma and generalizes the tracing attack technique for privacy-constrained lower bounds. This lower bound argument can be of independent interest as it is applicable to general parametric models. Simulated and real data experiments are conducted to demonstrate the numerical performance of our algorithms.

研究动机与目标

  • 开发适用于广义线性模型(GLMs)参数估计的差分隐私算法,在隐私约束下保持统计准确性。
  • 为GLM参数估计建立隐私约束下的极小化极大下界,以评估所提算法的统计最优性。
  • 将隐私-准确率权衡分析从均值估计或线性回归等简单模型扩展到更广泛的GLM类。
  • 在稀疏性假设下,证明高维私有GLM估计的可行性,与局部差分隐私下的不可能性结果形成对比。

提出的方法

  • 通过在梯度中添加噪声,构建一种私有的投影梯度下降算法(算法1),确保$(\varepsilon,\delta)$-差分隐私。
  • 将迭代硬阈值框架适配于高维稀疏GLMs,结合噪声和稀疏性约束,以保持隐私性和收敛性。
  • 采用一种基于Stein引理的新下界技术,推广追踪攻击方法,适用于一般参数模型。
  • 为低维和高维GLM设置推导出隐私约束下的极小化极大下界,证明所提算法的理论最优性。
  • 利用集中不等式和矩矩界分析在差分隐私下参数估计误差的期望$\ell_2$范数。
  • 利用GLMs的得分函数和费雪信息结构,推导出在隐私约束下对参数估计误差的界。

实验结果

研究问题

  • RQ1能否在GLMs中实现近最优统计准确率的差分隐私参数估计?
  • RQ2GLMs中隐私与估计准确率之间的基本权衡是什么?其随样本量和维度如何变化?
  • RQ3在高维稀疏GLMs中,私有估计是否仍可行?稀疏性在降低隐私成本方面起到什么作用?
  • RQ4如何使用超越现有追踪攻击方法的新技术,推导出隐私约束下GLM估计的极小化极大下界?

主要发现

  • 所提的噪声投影梯度下降算法在低维GLMs中实现了$\ell_2$估计误差$\tilde{O}\left(\frac{d^{2}\log(1/\delta)}{n^{2}\varepsilon^{2}}\right)$。
  • 对于具有$s^*$-稀疏参数的高维稀疏GLMs,噪声迭代硬阈值算法实现了$\ell_2$误差$\tilde{O}\left(\frac{(s^{*}\log d)^{2}\log(1/\delta)}{n^{2}\varepsilon^{2}}\right)$,显示出对稀疏性的线性依赖和对维度的对数依赖。
  • 通过基于Stein引理的技术推导出的极小化极大下界与上界仅相差对数因子,证明了所提算法的近似最优性。
  • 该下界技术推广了追踪攻击方法,适用于GLMs之外的一般参数模型,表明其具有更广泛的理论适用性。
  • 模拟实验和真实数据实验验证了所提私有算法的数值性能和实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。