Skip to main content
QUICK REVIEW

[论文解读] Private Identity Testing for High-Dimensional Distributions

Clément L. Canonne, Gautam Kamath|arXiv (Cornell University)|May 28, 2019
Privacy-Preserving Technologies in Data参考文献 85被引用 9
一句话总结

该论文提出了一种针对超立方体 {±1}^d 上高维分布的差分隐私身份检验算法。该算法采用自适应误差阈值的递归Lipschitz扩展检验,实现了在维度 d 上亚线性增长的样本复杂度,其中隐私参数 ε 和 β 分别控制准确性和置信度。

ABSTRACT

In this work we present novel differentially private identity (goodness-of-fit) testers for natural and widely studied classes of multivariate product distributions: Gaussians in $\mathbb{R}^d$ with known covariance and product distributions over $\{\pm 1\}^{d}$. Our testers have improved sample complexity compared to those derived from previous techniques, and are the first testers whose sample complexity matches the order-optimal minimax sample complexity of $O(d^{1/2}/α^2)$ in many parameter regimes. We construct two types of testers, exhibiting tradeoffs between sample complexity and computational complexity. Finally, we provide a two-way reduction between testing a subclass of multivariate product distributions and testing univariate distributions, and thereby obtain upper and lower bounds for testing this subclass of product distributions.

研究动机与目标

  • 设计一种针对超立方体 {±1}^d 上高维分布的差分隐私身份检验协议。
  • 在确保 (ε, β)-差分隐私和恒定统计准确性的前提下,最小化样本复杂度。
  • 通过递归地利用Lipschitz扩展检验细化误差阈值,应对高维性的挑战。
  • 实现样本复杂度在 d 上亚线性增长,优于以往非私有或非自适应的方法。
  • 为递归测试过程的隐私性、正确性和收敛性提供理论保证。

提出的方法

  • 该算法初始化 M = ⌈log n⌉,并将 ε′ = ε/M,以在递归步骤中分配隐私预算。
  • 定义 Δ* 为基于 d、√(nd) 和 (ln(1/β))/ε′ 的复合阈值,确保在各尺度下的鲁棒性。
  • 迭代计算 m 从 1 到 M−1 的 Δ^(m),使用递归更新:Δ^(m+1) = 11(d + √(nd) + Δ^(m)/(nε′) + √(Δ^(m)/ε′)) · ln(1/β)。
  • 在每一步中,调用 LipschitzExtensionTest(X, ε′, Δ^(m), β) 以检查分布是否在 Δ^(m) 距离内接近目标分布。
  • 如果任意阶段的测试拒绝,则算法立即返回拒绝,从而保证隐私性和正确性。
  • 当 Δ^(m) ≤ Δ* 时退出循环,并将最终的 Δ^(M) 设为 Δ^(m),以完成决策过程。

实验结果

研究问题

  • RQ1能否为 {±1}^d 上的高维分布构造一种具有亚线性样本复杂度的差分隐私身份检验?
  • RQ2如何在递归步骤中自适应地分配隐私预算,以同时保持准确性和隐私性?
  • RQ3在高维设置下,私密身份检验所需的最小样本复杂度是多少?
  • RQ4与单步方法相比,递归阈值机制如何提升鲁棒性?
  • RQ5针对递归Lipschitz扩展检验的收敛性和正确性,可以证明哪些理论保证?

主要发现

  • 通过在递归应用Lipschitz扩展检验时使用 ε′ = ε/M,该算法实现了 (ε, β)-差分隐私。
  • 最终的样本复杂度被限制在 O(d + √(nd) + (1/ε′) · √(Δ^(m)/ε′)) · ln(1/β) 范围内,其中 Δ^(m) 随 n 对数增长。
  • 该算法在 O(log n) 次迭代内终止,确保在高维情形下的效率。
  • 递归阈值更新确保 Δ^(m) 缓慢增长,从而在保持隐私的同时维持准确性。
  • 如果任意中间Lipschitz扩展测试失败,测试将返回拒绝,从而在隐私约束下保证正确性。
  • 该方法在样本复杂度中对 d 实现了亚线性依赖,使其可扩展至高维数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。