Skip to main content
QUICK REVIEW

[论文解读] Privacy Analysis of Online Learning Algorithms via Contraction Coefficients.

Shahab Asoodeh, Mario Díaz|arXiv (Cornell University)|Dec 20, 2020
Privacy-Preserving Technologies in Data参考文献 90被引用 6
一句话总结

本文提出了一种新颖的信息论框架,利用从 $f$-散度导出的压缩系数,分析在线学习算法的差分隐私。通过将多布拉辛(Dobrushin)的压缩系数推广至 $E_\gamma$-散度(等价于近似差分隐私),实现了对隐私参数的直接计算,该方法在梯度下降算法上得到验证,并可适用于单遍批量学习算法。

ABSTRACT

We propose an information-theoretic technique for analyzing privacy guarantees of online algorithms. Specifically, we demonstrate that differential privacy guarantees of iterative algorithms can be determined by a direct application of contraction coefficients derived from strong data processing inequalities for $f$-divergences. Our technique relies on generalizing the Dobrushin's contraction coefficient for total variation distance to an $f$-divergence known as $E_\gamma$-divergence. $E_\gamma$-divergence, in turn, is equivalent to approximate differential privacy. As an example, we apply our technique to derive the differential privacy parameters of gradient descent. Moreover, we also show that this framework can be tailored to batch learning algorithms that can be implemented with one pass over the training dataset.

研究动机与目标

  • 开发一种通用的信息论方法,用于量化迭代式在线学习算法中的隐私性。
  • 建立 $f$-散度的压缩系数与差分隐私保障之间的联系。
  • 将多布拉辛的压缩系数推广至 $E_\gamma$-散度,该散度对应于近似差分隐私。
  • 将该框架应用于推导在线设置下梯度下降的精确隐私参数。
  • 将该方法扩展至可单次遍历处理数据的批量学习算法。

提出的方法

  • 该方法利用 $f$-散度的强数据处理不等式,对迭代算法中的隐私损失进行上界估计。
  • 提出将多布拉辛的压缩系数推广至 $E_\gamma$-散度,这是一种与近似差分隐私相关的特定 $f$-散度。
  • 压缩系数通过测量输入分布间散度的减少程度,量化了跨迭代过程中隐私的保留程度。
  • 通过分析学习算法更新规则的压缩系数,计算隐私参数。
  • 通过将更新机制建模为马尔可夫转移,该方法可适用于在线学习和单遍批量学习算法。
  • 该方法可直接推导出 $(\varepsilon, \delta)$-差分隐私参数,无需依赖复杂的组合定理。

实验结果

研究问题

  • RQ1如何利用 $f$-散度的压缩系数来量化在线学习算法中的隐私性?
  • RQ2$E_\gamma$-散度与近似差分隐私之间存在何种关系?
  • RQ3该广义压缩系数框架能否应用于梯度下降,以推导出紧致的隐私边界?
  • RQ4该方法在多大程度上可扩展至单次遍历处理的批量学习算法?
  • RQ5与现有的基于组合的隐私分析技术相比,该框架在紧致性和通用性方面表现如何?

主要发现

  • $E_\gamma$-散度被证明等价于近似差分隐私,从而在信息论度量与隐私保障之间建立了直接联系。
  • $E_\gamma$-散度的压缩系数为迭代式在线学习算法中的隐私损失提供了紧致的上界。
  • 该框架成功利用压缩系数推导出梯度下降在在线设置下的 $(\varepsilon, \delta)$-差分隐私参数。
  • 该方法可推广至可单次遍历训练数据的批量学习算法。
  • 该方法避免了对序列组合定理的依赖,提供了更直接且可能更紧致的隐私分析。
  • 利用强数据处理不等式,实现了对学习算法的非渐近、分布无关的隐私分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。