Skip to main content
QUICK REVIEW

[论文解读] Private Counting from Anonymous Messages: Near-Optimal Accuracy with Vanishing Communication Overhead

Badih Ghazi, Ravi Kumar|arXiv (Cornell University)|Jun 8, 2021
Privacy-Preserving Technologies in Data被引用 19
一句话总结

本文提出了一种通信高效的差分隐私算法,用于在洗牌模型中进行二值求和与直方图聚合,实现了接近中央模型性能的近乎最优准确率,同时保持了与非私有基线相当的用户通信量。该方法采用了一种新颖的编码策略和曲棍球棒散度分析,以在严格的隐私约束下最小化误差。

ABSTRACT

Differential privacy (DP) is a formal notion for quantifying the privacy loss of algorithms. Algorithms in the central model of DP achieve high accuracy but make the strongest trust assumptions whereas those in the local DP model make the weakest trust assumptions but incur substantial accuracy loss. The shuffled DP model (Bittau et al., 2017; Erlingsson et al., 2019; Cheu et al., 2019) has recently emerged as a feasible middle ground between the central and local models, providing stronger trust assumptions than the former while promising higher accuracies than the latter. In this paper, we obtain practical communication-efficient algorithms in the shuffled DP model for two basic aggregation primitives used in machine learning: 1) binary summation, and 2) histograms over a moderate number of buckets. Our algorithms achieve accuracy that is arbitrarily close to that of central DP algorithms with an expected communication per user essentially matching what is needed without any privacy constraints! We demonstrate the practicality of our algorithms by experimentally comparing their performance to several widely-used protocols such as Randomized Response (Warner, 1965) and RAPPOR (Erlingsson et al., 2014).

研究动机与目标

  • 解决分布式数据聚合中通信效率、准确率与隐私之间的权衡问题。
  • 在洗牌差分隐私模型下,开发适用于二值求和与直方图聚合的实用协议。
  • 在仅需极少信任的前提下,实现接近中央模型的准确率,优于本地模型。
  • 将每位用户的通信开销最小化,以匹配非私有系统,从而实现可扩展的部署。
  • 对洗牌模型中的隐私-准确率-通信权衡关系提供理论与实证验证。

提出的方法

  • 提出一种新型编码方案,将用户输入映射为带有受控噪声的消息,从而在洗牌差分隐私下实现准确的聚合。
  • 利用曲棍球棒散度形式化地界定了协议的隐私损失(ε, δ),确保满足(ε, δ)-差分隐私。
  • 采用分组消息分析方法,降低计算隐私边界的复杂度,将非目标消息合并为单一结果。
  • 应用剪枝技术,以 O(n·polylog(n/δ)) 时间高效计算独立同分布随机变量之和的期望正值部分。
  • 基于同一核心框架,设计了适用于二值求和(计数)和多桶直方图的协议。
  • 通过与 Randomized Response 和 RAPPOR 等成熟协议的实验对比,验证了该方法的有效性。

实验结果

研究问题

  • RQ1我们能否在洗牌模型中设计一种二值求和的差分隐私协议,实现接近中央模型的准确率,同时通信量最小?
  • RQ2在洗牌模型中,如何在保持强隐私保证的前提下,最小化每位用户的通信成本?
  • RQ3在通信受限的条件下,洗牌模型下直方图聚合的准确率理论极限是什么?
  • RQ4我们能否实现优于本地模型和中央模型的隐私-准确率-通信权衡?
  • RQ5如何高效计算洗牌模型中复杂分组消息分布的隐私参数(ε, δ)?

主要发现

  • 所提出的协议实现的估计误差可任意接近中央模型算法的误差,显著优于本地模型基线。
  • 每位用户的期望通信量渐近最优——与非私有协议的通信成本完全一致。
  • 对于二值求和,该协议的平方误差在常数因子范围内接近中央差分隐私下离散拉普拉斯机制的性能。
  • 该方法在中等数量桶数的直方图聚合中实现了近乎最优的准确率,且通信开销极低。
  • 实证评估表明,在准确率和通信效率方面,该方法优于 Randomized Response 和 RAPPOR。
  • 通过采用分组消息分析与高效计算期望正值部分的方法,使得该协议可大规模实用化部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。