Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Identity and Closeness Testing of Discrete Distributions

Maryam Aliakbarpour, Ilias Diakonikolas|arXiv (Cornell University)|Jul 18, 2017
Privacy-Preserving Technologies in Data参考文献 19被引用 10
一句话总结

本文提出了用于离散分布身份检验与接近性检验的样本高效差分隐私算法,利用了潘宁基(Paninski)和基于碰撞的均匀性检验器的隐私变体。与非私有的对应方法相比,仅引入了较小的乘法开销,实现了近似最优的样本复杂度,在次线性范围内展现了强大的隐私-效用权衡。

ABSTRACT

We investigate the problems of identity and closeness testing over a discrete population from random samples. Our goal is to develop efficient testers while guaranteeing Differential Privacy to the individuals of the population. We describe an approach that yields sample-efficient differentially private testers for these problems. Our theoretical results show that there exist private identity and closeness testers that are nearly as sample-efficient as their non-private counterparts. We perform an experimental evaluation of our algorithms on synthetic data. Our experiments illustrate that our private testers achieve small type I and type II errors with sample size sublinear in the domain size of the underlying distributions.

研究动机与目标

  • 在次线性范围内,为离散分布的身份检验与接近性检验开发高效的差分隐私测试器。
  • 在保持强大隐私保障的前提下,最小化差分隐私引入的样本复杂度开销。
  • 将非私有的分布检验技术——特别是均匀性检验的约化方法——扩展到私有设置中,同时保持效率损失最小。
  • 设计在样本量为域大小的次线性函数时,仍能实现低第一类与第二类错误的私有测试器。
  • 提供首个具有可证明隐私与准确度保障的样本高效差分隐私接近性测试器。

提出的方法

  • 采用从身份检验到均匀性检验的黑箱约化方法,通过私有均匀性测试器实现私有身份检验,仅使样本量增加常数倍。
  • 基于仅出现一次的元素计数,开发了潘宁基均匀性测试器的私有版本,该统计量具有低敏感性,支持高效的拉普拉斯噪声添加。
  • 引入预处理步骤,拒绝包含多次出现元素的样本,以降低基于碰撞的统计量在私有接近性检验中的敏感性。
  • 使用拉普拉斯机制确保差分隐私,通过敏感性分析证明修改后的统计量具有有界敏感性(最多为8)。
  • 应用切比雪夫不等式与方差界分析,在私有测试框架下控制第一类与第二类错误的概率。
  • 对测试统计量采用两段式分析:分别针对期望计数较高的元素与低计数元素,以控制方差并确保准确性。

实验结果

研究问题

  • RQ1是否能够实现样本复杂度接近非私有测试器的差分隐私身份检验?
  • RQ2在离散分布的接近性检验中,实现差分隐私所需的最小样本复杂度开销是多少?
  • RQ3如何在不引入过高的样本成本的前提下,对高敏感性统计量(如碰撞数)进行隐私化处理?
  • RQ4从身份检验到均匀性检验的约化方法能否在私有设置中以最小效率损失进行适配?
  • RQ5在次线性范围内,私有测试器在多大程度上能实现低第一类与第二类错误?

主要发现

  • 所提出的私有身份测试器的样本复杂度与非私有的潘宁基测试器仅相差常数因子,开销为 O(√n/ε² + √n/(ε√ξ))。
  • 基于私有化碰撞方法的私有接近性测试器实现了次线性样本复杂度,是首个具有可证明隐私与准确度保障的此类方法。
  • 测试统计量的方差被控制在 O(min{m,n}) 加上与分布间 L2 距离相关的项,从而可通过切比雪夫不等式控制错误概率。
  • 当样本量足够大且测试统计量的期望值足够大时,第一类错误被控制在 1/3 以内。
  • 通过拉普拉斯机制实现隐私保障,最终统计量的敏感性被证明至多为 8,从而确保 ξ-差分隐私。
  • 实验评估表明,私有测试器在样本量为域大小的次线性函数时,仍能实现较小的第一类与第二类错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。