[论文解读] Distributed Differentially Private Computation of Functions with Correlated Noise
本文提出 CAPE(相关性辅助私有估计),一种新颖的分布式差分隐私框架,通过在各站点之间引入相关噪声,提升了去中心化机器学习中的效用。通过利用估计理论中的噪声相关性,CAPE 在严格隐私保障下,于合成数据和真实世界回归与神经网络任务中,实现了接近集中式非私有学习的性能,优于现有方法。
Many applications of machine learning, such as human health research, involve processing private or sensitive information. Privacy concerns may impose significant hurdles to collaboration in scenarios where there are multiple sites holding data and the goal is to estimate properties jointly across all datasets. Differentially private decentralized algorithms can provide strong privacy guarantees. However, the accuracy of the joint estimates may be poor when the datasets at each site are small. This paper proposes a new framework, Correlation Assisted Private Estimation (CAPE), for designing privacy-preserving decentralized algorithms with better accuracy guarantees in an honest-but-curious model. CAPE can be used in conjunction with the functional mechanism for statistical and machine learning optimization problems. A tighter characterization of the functional mechanism is provided that allows CAPE to achieve the same performance as a centralized algorithm in the decentralized setting using all datasets. Empirical results on regression and neural network problems for both synthetic and real datasets show that differentially private methods can be competitive with non-private algorithms in many scenarios of interest.
研究动机与目标
- 解决现有分布式差分隐私算法在本地数据集较小时效用较差的问题。
- 在诚实但好奇威胁模型下,改善去中心化机器学习中的隐私-效用权衡。
- 在不共享原始数据的前提下,实现在多个数据站点上的准确联合估计,尤其适用于医疗等隐私敏感领域。
- 开发一种在差分隐私下接近集中式非私有学习性能的分布式设置方法。
- 为分布式系统中可分函数的差分隐私计算提供实用且理论基础扎实的框架。
提出的方法
- 提出 CAPE 框架,通过在不同分布式站点的差分隐私消息中引入(反)相关噪声,降低总体噪声方差。
- 提出 CAPEFM 算法,一种增强型功能机制,可更高效地计算连续可微函数的敏感度。
- 采用估计理论分析噪声添加过程,以在保持差分隐私的前提下最小化扰动输出的方差。
- 使用对功能机制的更紧致表征,以减少加性噪声,尤其适用于线性和逻辑回归问题。
- 将该协议应用于分布式优化中的可分损失函数,如经验风险最小化。
- 在合谋站点数量不超过 ⌈S/3⌉−1 的条件下,保证 (ε,δ)-差分隐私。
实验结果
研究问题
- RQ1在分布式站点之间引入相关噪声,是否能在不损害隐私的前提下提升差分隐私计算的效用?
- RQ2在本地数据集较小的去中心化机器学习中,如何显著改善隐私-效用权衡?
- RQ3分布式差分隐私算法在多大程度上可实现与集中式非私有学习相当的性能?
- RQ4噪声相关性对差分隐私函数估计中的敏感度计算与方差有何影响?
- RQ5所提出的框架能否推广至常见机器学习优化问题,如 ERM 和神经网络训练?
主要发现
- 在 ε、δ 和数据集大小 N 的适当条件下,CAPEFM 算法实现了与非私有聚合数据场景相当的效用水平。
- 在合成数据和真实数据集(Crime、Twitter)上,CAPEFM 显著优于传统 DP 算法(如 dp-fm 和 objPert),尤其在中等 N 和 δ 条件下。
- 随着站点数量 N 增加,性能提升;当 N 和 ε 足够大时,CAPEFM 的效用趋近于非私有基线水平。
- 与本地方法和凸组合方法相比,该框架在 δ 中等偏小且 N 不太小时表现出更优的效用。
- 该方法在线性回归和深度神经网络分类任务中均展现出强劲的实证性能,与非私有基线具有竞争力。
- CAPEFM 中的分析性敏感度计算相比标准方法显著减少了加性噪声,尤其在低维设置下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。