Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Bayesian Learning on Distributed Data

Mikko Heikkilä, Eemil Lagerspetz|arXiv (Cornell University)|Mar 3, 2017
Privacy-Preserving Technologies in Data参考文献 28被引用 15
一句话总结

本文提出了一种用于分布式数据的差分隐私贝叶斯学习框架,结合安全多方计算(DCA)与基于高斯机制的噪声注入,实现高效且隐私保护的推理。该方法在保持接近最优准确率的同时,实现了与可信聚合者设置相当的性能,且在数据规模和参与方数量增加时仍能高效扩展,展示了在最小隐私成本下对线性回归任务的实用性。

ABSTRACT

Many applications of machine learning, for example in health care, would benefit from methods that can guarantee privacy of data subjects. Differential privacy (DP) has become established as a standard for protecting learning results. The standard DP algorithms require a single trusted party to have access to the entire data, which is a clear weakness. We consider DP Bayesian learning in a distributed setting, where each party only holds a single sample or a few samples of the data. We propose a learning strategy based on a secure multi-party sum function for aggregating summaries from data holders and the Gaussian mechanism for DP. Our method builds on an asymptotically optimal and practically efficient DP Bayesian inference with rapidly diminishing extra cost.

研究动机与目标

  • 解决现有差分隐私(DP)机器学习方法依赖单一可信方并需完全访问数据的局限性。
  • 在每个客户端仅持有部分数据的分布式环境中,实现DP贝叶斯推理,保护个体隐私。
  • 最小化分布式聚合过程中引入的额外噪声,确保学习模型的高实用性。
  • 开发一种实用、高效且可证明私密的框架,结合安全多方计算与DP贝叶斯推理。

提出的方法

  • 使用安全多方计算(DCA)协议,在不泄露个体数据的情况下,计算分布式客户端之间充分统计量的总和。
  • 通过在聚合器级别对充分统计量的总和注入噪声,应用高斯机制实现(ϵ, δ)-差分隐私。
  • 采用M个独立计算节点的秘密共享机制,确保任一单个节点均无法重构个体贡献。
  • 使用定点算术,实现在总和聚合过程中噪声的精确抵消,确保噪声分布的正确性。
  • 在分布式环境中引入私有归一化过程,用于数据缩放,以维持隐私保证。
  • 将渐近最优的充分统计量扰动(SSP)方法与分布式噪声注入相结合,保持统计效率。

实验结果

研究问题

  • RQ1是否可以在完全分布式环境中,无需可信聚合者,有效执行差分隐私贝叶斯学习?
  • RQ2如何在保持隐私的前提下,使分布式DP学习中的噪声方差尽可能低?
  • RQ3在贝叶斯推理中使用安全多方计算进行DP求和聚合,其性能开销如何?
  • RQ4与可信聚合者基线相比,分布式DP方法在模型准确率和隐私预算效率方面表现如何?
  • RQ5是否可以在不损害DP保证的前提下,实现在分布式环境中的私有数据归一化?

主要发现

  • 分布式DP贝叶斯学习方法的预测性能几乎与可信聚合者基线无法区分,未出现显著准确率下降。
  • 运行时间随客户端数量和特征数量的增加而适度增长,表明在基于Spark的原型系统中具备良好的实际可扩展性。
  • 实际中,分布式环境引入的额外噪声可忽略不计,结果与可信聚合者设置基本一致。
  • 在分布式环境中成功实现了私有数据归一化,使充分统计量扰动方法能够实现完整的隐私保证。
  • 该方法保持了SSP方法的渐近最优性,随着参与方数量增加,收敛至非私密推理的性能水平。
  • 对称密码学与定点算术的使用,实现了高效、低开销的安全计算,无需同态加密。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。