Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Learning Needs Hidden State (Or Much Faster Convergence)

Jiayuan Ye, Reza Shokri|arXiv (Cornell University)|Mar 10, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文提出了一种新颖的差分隐私随机梯度下降(DP-SGD)隐私分析方法,利用隐藏模型状态,并通过子采样和随机后处理实现隐私放大。通过建模在“洗牌与分块”和“无放回采样”小批量训练方案下的隐私动态,作者证明了在强凸光滑损失下,隐私界收敛速度呈指数级,显著优于基于组合的界——尤其是在训练若干个周期后。

ABSTRACT

Prior work on differential privacy analysis of randomized SGD algorithms relies on composition theorems, where the implicit (unrealistic) assumption is that the internal state of the iterative algorithm is revealed to the adversary. As a result, the Rényi DP bounds derived by such composition-based analyses linearly grow with the number of training epochs. When the internal state of the algorithm is hidden, we prove a converging privacy bound for noisy stochastic gradient descent (on strongly convex smooth loss functions). We show how to take advantage of privacy amplification by sub-sampling and randomized post-processing, and prove the dynamics of privacy bound for "shuffle and partition" and "sample without replacement" stochastic mini-batch gradient descent schemes. We prove that, in these settings, our privacy bound converges exponentially fast and is substantially smaller than the composition bounds, notably after a few number of training epochs. Thus, unless the DP algorithm converges fast, our privacy analysis shows that hidden state analysis can significantly amplify differential privacy.

研究动机与目标

  • 解决基于组合的DP-SGD隐私分析的局限性,后者因假设可完全访问内部算法状态而高估隐私损失。
  • 通过仅分析最终模型参数(隐藏状态)来改进差分隐私学习中的隐私-准确率权衡,更贴近实际部署场景。
  • 通过利用子采样和随机后处理的隐私放大效应,为多周期DP-SGD开发更紧致的隐私界。
  • 在隐藏状态假设下,对“洗牌与分块”和“无放回采样”小批量训练方案提供严谨分析。
  • 证明隐藏状态分析在收敛缓慢时,其隐私界显著小于组合定理的界。

提出的方法

  • 在仅发布最终模型参数、隐藏训练过程内部状态的假设下,建模带有噪声的随机梯度下降。
  • 通过将带噪声的GD更新分解为两步(较小噪声更新后接纯高斯噪声)的方式,提出一种新的随机后处理隐私放大界。
  • 利用子采样和后处理放大效应,为“洗牌与分块”和“无放回采样”小批量选择方案,证明新的Rényi差分隐私(RDP)界。
  • 将分析应用于强凸光滑损失函数,包括使用梯度裁剪的逻辑回归,以确保有界敏感性。
  • 通过一种新颖的分解技术,将噪声缩放与梯度更新分离,推导出比先前工作[15]更紧致的界。
  • 通过分析逻辑回归中的梯度敏感性和Hessian性质,验证理论界,确保光滑性和强凸性。

实验结果

研究问题

  • RQ1在多周期DP-SGD中,隐藏状态隐私分析能否显著优于基于组合的方法,获得更紧致的隐私界?
  • RQ2通过子采样和随机后处理实现的隐私放大,如何影响随机梯度下降中隐私界收敛的动态?
  • RQ3小批量选择策略——“洗牌与分块”和“无放回采样”——对DP-SGD中隐私损失动态有何影响?
  • RQ4在隐藏状态假设下,隐私界是否能实现指数级快速收敛,尤其是在收敛缓慢的模型中?
  • RQ5与先前工作[15]相比,该方法在随机小批量训练中,于紧致性和通用性方面有何改进?

主要发现

  • 所提出的隐私界在“洗牌与分块”和“无放回采样”方案下收敛速度呈指数级,而基于组合的界则随周期线性增长。
  • 对于强凸光滑损失函数,仅在训练几个周期后,隐私界就显著小于基于组合的界。
  • 通过将带噪声更新新颖地分解为小噪声步骤与后处理步骤,该分析在全梯度下降中获得比先前工作[15]更紧致的界。
  • 该方法显著改善了DP-SGD中的隐私-准确率权衡,尤其适用于收敛缓慢或适中的模型。
  • 在隐藏状态设定下,子采样和后处理的隐私放大被有效利用,导致隐私损失随时间指数衰减。
  • 该理论框架适用于实际场景,如使用梯度裁剪的逻辑回归,确保有界敏感性和光滑性,从而支持严谨分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。