[论文解读] Differentially Private (Gradient) Expectation Maximization Algorithm with Statistical Guarantees
本文提出了首个具有有限样本统计保证的差分隐私(DP)梯度期望最大化(EM)算法,通过一种新颖的重尾分布均值私有估计机制,实现了对高斯混合模型的近最优估计误差界 $\tilde{O}(d/\sqrt{n\epsilon})$ 和对回归混合模型与缺失协变量线性回归模型的 $\tilde{O}(d^{3/2}/\sqrt{n\epsilon})$ 误差界,并扩展至本地差分隐私模型。
(Gradient) Expectation Maximization (EM) is a widely used algorithm for estimating the maximum likelihood of mixture models or incomplete data problems. A major challenge facing this popular technique is how to effectively preserve the privacy of sensitive data. Previous research on this problem has already lead to the discovery of some Differentially Private (DP) algorithms for (Gradient) EM. However, unlike in the non-private case, existing techniques are not yet able to provide finite sample statistical guarantees. To address this issue, we propose in this paper the first DP version of (Gradient) EM algorithm with statistical guarantees. Moreover, we apply our general framework to three canonical models: Gaussian Mixture Model (GMM), Mixture of Regressions Model (MRM) and Linear Regression with Missing Covariates (RMC). Specifically, for GMM in the DP model, our estimation error is near optimal in some cases. For the other two models, we provide the first finite sample statistical guarantees. Our theory is supported by thorough numerical experiments.
研究动机与目标
- 解决现有差分隐私EM算法在有限样本下缺乏统计保证的问题。
- 设计一种针对重尾分布的新型私有均值估计机制,改进先前工作并扩展至本地差分隐私。
- 首次为标准模型(GMM、MRM 和 RMC)的DP梯度EM版本建立有限样本统计误差界。
- 通过理论和实证分析,在真实和合成数据集上验证所提出的DP-梯度EM框架的有效性。
提出的方法
- 基于Wang等人(2020)的分析,提出一种改进的私有均值估计机制,专为重尾分布设计。
- 将该机制应用于DP-梯度EM框架中,通过精细的噪声校准确保 $ (\epsilon,\delta) $-差分隐私。
- 利用次高斯范数分析,控制EM更新步骤中梯度函数的敏感性。
- 通过浓度不等式和梯度分量的次高斯尾部特性,推导出估计误差界。
- 将私有均值机制扩展至本地差分隐私模型,支持去中心化部署。
- 采用有界初始化区域 $ \mathcal{B} $,以确保迭代更新中的收敛性并控制误差传播。
实验结果
研究问题
- RQ1差分隐私梯度EM算法能否实现与非私有方法相当的有限样本统计误差界?
- RQ2如何改进重尾分布的私有均值估计,以支持DP下的鲁棒统计学习?
- RQ3在标准模型(如GMM、MRM和RMC)中,DP-梯度EM算法可实现的最优估计误差率是多少?
- RQ4所提出的私有均值估计机制能否扩展至本地DP模型,从而支持去中心化数据处理?
- RQ5理论误差界与私有设置下的极小极大最优率相比如何?
主要发现
- 所提出的DP-梯度EM在高斯混合模型中实现了 $ \tilde{O}(d/\sqrt{n\epsilon}) $ 的估计误差,该结果在某些情形下为近最优。
- 对于回归混合模型和缺失协变量线性回归模型,首次建立了有限样本统计保证,误差界为 $ \tilde{O}(d^{3/2}/\sqrt{n\epsilon}) $。
- 所提出的私有均值估计机制在Wang等人(2020)工作的基础上,通过更精细的分析和更好的重尾控制,实现了性能提升。
- 该机制是首个可扩展至本地差分隐私模型的机制,显著拓宽了其在去中心化数据场景中的适用性。
- 在真实和合成数据上的数值实验验证了理论误差界,并展示了在隐私约束下稳定的收敛性。
- 理论分析表明,通过适当的初始化,DP-梯度EM以高概率收敛至估计误差有界的解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。