Skip to main content
QUICK REVIEW

[论文解读] Mean Estimation with User-level Privacy under Data Heterogeneity

Rachel Cummings, Vitaly Feldman|arXiv (Cornell University)|Jul 28, 2023
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文提出了一种针对异构用户数据的差分隐私均值估计算法,其中用户从不同分布中贡献不同数量的样本。通过使用一种非线性、基于截断的估计器,该算法能够适应数据异构性和未知方差,在用户级别差分隐私下实现渐近最优误差,证明了在估计误差方面,隐私约束不会带来渐近代价。

ABSTRACT

A key challenge in many modern data analysis tasks is that user data are heterogeneous. Different users may possess vastly different numbers of data points. More importantly, it cannot be assumed that all users sample from the same underlying distribution. This is true, for example in language data, where different speech styles result in data heterogeneity. In this work we propose a simple model of heterogeneous user data that allows user data to differ in both distribution and quantity of data, and provide a method for estimating the population-level mean while preserving user-level differential privacy. We demonstrate asymptotic optimality of our estimator and also prove general lower bounds on the error achievable in the setting we introduce.

研究动机与目标

  • 解决用户级别数据异构性场景下的均值估计挑战,其中用户具有不同的样本量和分布。
  • 设计一种差分隐私算法,在保持估计准确性的同时保护用户级别隐私,即使在分布和样本量异构的情况下亦成立。
  • 证明所提出的估计器可实现渐近最优误差,且隐私约束不会带来额外代价。
  • 建立异构、私有设置下估计误差的一般下界,以刻画基本限制。
  • 在对基础元分布和数据异构性施加弱假设的前提下,为估计器的性能提供理论保证。

提出的方法

  • 引入一个模型,其中每个用户的数据显示自参数为 $ p_i $ 的伯努利分布,且 $ p_i $ 本身是从 $[0,1]$ 上的未知元分布 $ \mathcal{D} $ 中抽取的。
  • 提出一种非线性、差分隐私估计器,根据估计的方差和样本量自适应地截断用户贡献。
  • 采用两阶段估计过程:首先估计全局均值 $ p $ 和方差 $ \sigma_p^2 $,然后对个体用户估计应用隐私保护截断。
  • 通过高级组合定理实现隐私放大,并利用元分布和二项分布抽样的集中不等式。
  • 设计截断区间 $[\widehat{a}_i, \widehat{b}_i]$,在保证隐私的同时维持准确性,其宽度被限制在理想区间宽度的常数倍以内。
  • 利用对元分布和二项分布抽样的高概率界,确保估计器的鲁棒性和稳定性。

实验结果

研究问题

  • RQ1在用户级别数据异构性存在的情况下,差分隐私均值估计器能否实现渐近最优误差?
  • RQ2当用户数据分布和样本量变化时,隐私与估计准确率之间的基本权衡是什么?
  • RQ3即使全局方差未知,在异构数据设置下,用户级别隐私的代价是否在渐近意义上消失?
  • RQ4如何设计一种能同时适应每个用户样本数量和底层分布异构性的私有估计器?
  • RQ5在此异构、私有均值估计设置下,估计误差的最紧下界是什么?

主要发现

  • 所提出的差分隐私估计器实现了方差 $ \tilde{O}(\sigma_{\text{ideal}}^2) $,与非私有最优方差仅相差对数因子。
  • 该估计器是非线性的,表明线性估计器在数据异构性下不足以实现最优私有均值估计。
  • 在弱假设下,私有估计器的渐近误差匹配非私有下界,意味着隐私无渐近代价。
  • 估计器所用截断区间的宽度被限制在理想区间宽度的常数倍(6倍)以内,确保了鲁棒性。
  • 提出了一种新颖的下界技术,表明 $ \sigma_{\text{ideal}}^2 $ 接近在给定模型和隐私约束下可实现的最佳方差。
  • 当全局方差 $ \sigma_p^2 $ 未知时,该方法依然有效,估计器通过自适应截断和方差估计实现适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。