Skip to main content
QUICK REVIEW

[论文解读] Have it your way: Individualized Privacy Assignment for DP-SGD

Franziska Boenisch, Christopher Mühl|arXiv (Cornell University)|Mar 29, 2023
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文提出了一种新型的差分隐私随机梯度下降变体——个性化DP-SGD(IDP-SGD),为每个训练数据点分配独立的隐私预算,实现个性化的隐私保护。通过修改数据采样与梯度噪声缩放机制,IDP-SGD在不损害理论隐私保证的前提下,提升了隐私-效用权衡表现,在视觉与自然语言处理基准上均展现出显著的效用提升,适用于多样化的隐私偏好分布。

ABSTRACT

When training a machine learning model with differential privacy, one sets a privacy budget. This budget represents a maximal privacy violation that any user is willing to face by contributing their data to the training set. We argue that this approach is limited because different users may have different privacy expectations. Thus, setting a uniform privacy budget across all points may be overly conservative for some users or, conversely, not sufficiently protective for others. In this paper, we capture these preferences through individualized privacy budgets. To demonstrate their practicality, we introduce a variant of Differentially Private Stochastic Gradient Descent (DP-SGD) which supports such individualized budgets. DP-SGD is the canonical approach to training models with differential privacy. We modify its data sampling and gradient noising mechanisms to arrive at our approach, which we call Individualized DP-SGD (IDP-SGD). Because IDP-SGD provides privacy guarantees tailored to the preferences of individual users and their data points, we find it empirically improves privacy-utility trade-offs.

研究动机与目标

  • 为解决DP-SGD中统一隐私预算的局限性,该局限性假设所有用户具有相同的隐私偏好,而现实中隐私期望存在多样性。
  • 使个体在贡献数据参与机器学习训练时,能够指定其自身的期望隐私保护水平。
  • 开发一种实用且理论严谨的DP-SGD扩展,支持个体化隐私预算,同时保持端到端的差分隐私保证。
  • 在多种数据集与模型架构上,实证评估个体化预算分配在隐私与效用之间权衡的表现。

提出的方法

  • 提出一种改进的数据采样机制(Sample),按各数据点的个体隐私预算比例选择训练样本,提高高隐私需求数据被使用的频率。
  • 提出一种个体化噪声缩放机制(Scale),通过调整裁剪范数乘数,实现每样本的噪声尺度调节,从而在批量噪声添加框架内实现细粒度的隐私预算分配。
  • 理论分析表明,两种机制均能保持个体化隐私参数(εp, δ)下的差分隐私,确保每个数据点的隐私预算得到尊重。
  • 采用RDP(Rényi差分隐私)分析推导隐私边界,并通过标准转换技术将个体组级别的RDP参数转换为(εp, δ)-DP保证。
  • 在训练开始前,通过预训练配置步骤(算法2与3)基于期望隐私预算,确定最优采样率与噪声乘数。
  • 将每个隐私组视为并行运行的独立子采样高斯机制,各自拥有独立的隐私参数,实现组间隐私成本的线性累积。

实验结果

研究问题

  • RQ1与统一预算分配相比,个体化隐私预算是否能改善DP-SGD中的隐私-效用权衡?
  • RQ2当为不同训练样本分配不同隐私预算时,如何保持差分隐私?
  • RQ3支持个体化采样与噪声缩放的改进型DP-SGD,其理论隐私保证为何?
  • RQ4在用户隐私偏好分布不同的情况下,IDP-SGD的性能表现如何?
  • RQ5个体化预算分配能否在标准DP-SGD框架内高效实现,且不牺牲训练效率?

主要发现

  • IDP-SGD通过允许高隐私期望用户获得更强的保护预算,同时让低隐私期望用户以更少噪声训练,从而提升模型准确率,实现了更优的隐私-效用权衡。
  • 理论分析证实,Sample与Scale两种机制均满足个体化(εp, δ)-差分隐私,且隐私成本在各隐私组间线性累积。
  • 在视觉与自然语言处理数据集上的实证评估显示,当隐私偏好分布异质时,多种模型架构均表现出一致的效用增益。
  • 即使部分用户隐私容忍度极低,系统仍能维持强隐私保证,因为整体机制确保不会违反最弱隐私预算。
  • 所提机制高效且兼容标准DP-SGD实现,噪声缩放通过裁剪范数调整实现,而非逐样本添加噪声。
  • 结果表明,当隐私偏好呈现偏态分布时,个体化预算分配尤为有益,可避免对低关注度数据点过度保护而损害模型准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。