[论文解读] Private Identity Testing for High-Dimensional Distributions
该论文提出了一种针对超立方体 {±1}^d 上高维分布的差分隐私身份检验算法。该算法采用自适应误差阈值的递归Lipschitz扩展检验,实现了在维度 d 上亚线性增长的样本复杂度,其中隐私参数 ε 和 β 分别控制准确性和置信度。
In this work we present novel differentially private identity (goodness-of-fit) testers for natural and widely studied classes of multivariate product distributions: Gaussians in $\mathbb{R}^d$ with known covariance and product distributions over $\{\pm 1\}^{d}$. Our testers have improved sample complexity compared to those derived from previous techniques, and are the first testers whose sample complexity matches the order-optimal minimax sample complexity of $O(d^{1/2}/α^2)$ in many parameter regimes. We construct two types of testers, exhibiting tradeoffs between sample complexity and computational complexity. Finally, we provide a two-way reduction between testing a subclass of multivariate product distributions and testing univariate distributions, and thereby obtain upper and lower bounds for testing this subclass of product distributions.
研究动机与目标
- 设计一种针对超立方体 {±1}^d 上高维分布的差分隐私身份检验协议。
- 在确保 (ε, β)-差分隐私和恒定统计准确性的前提下,最小化样本复杂度。
- 通过递归地利用Lipschitz扩展检验细化误差阈值,应对高维性的挑战。
- 实现样本复杂度在 d 上亚线性增长,优于以往非私有或非自适应的方法。
- 为递归测试过程的隐私性、正确性和收敛性提供理论保证。
提出的方法
- 该算法初始化 M = ⌈log n⌉,并将 ε′ = ε/M,以在递归步骤中分配隐私预算。
- 定义 Δ* 为基于 d、√(nd) 和 (ln(1/β))/ε′ 的复合阈值,确保在各尺度下的鲁棒性。
- 迭代计算 m 从 1 到 M−1 的 Δ^(m),使用递归更新:Δ^(m+1) = 11(d + √(nd) + Δ^(m)/(nε′) + √(Δ^(m)/ε′)) · ln(1/β)。
- 在每一步中,调用 LipschitzExtensionTest(X, ε′, Δ^(m), β) 以检查分布是否在 Δ^(m) 距离内接近目标分布。
- 如果任意阶段的测试拒绝,则算法立即返回拒绝,从而保证隐私性和正确性。
- 当 Δ^(m) ≤ Δ* 时退出循环,并将最终的 Δ^(M) 设为 Δ^(m),以完成决策过程。
实验结果
研究问题
- RQ1能否为 {±1}^d 上的高维分布构造一种具有亚线性样本复杂度的差分隐私身份检验?
- RQ2如何在递归步骤中自适应地分配隐私预算,以同时保持准确性和隐私性?
- RQ3在高维设置下,私密身份检验所需的最小样本复杂度是多少?
- RQ4与单步方法相比,递归阈值机制如何提升鲁棒性?
- RQ5针对递归Lipschitz扩展检验的收敛性和正确性,可以证明哪些理论保证?
主要发现
- 通过在递归应用Lipschitz扩展检验时使用 ε′ = ε/M,该算法实现了 (ε, β)-差分隐私。
- 最终的样本复杂度被限制在 O(d + √(nd) + (1/ε′) · √(Δ^(m)/ε′)) · ln(1/β) 范围内,其中 Δ^(m) 随 n 对数增长。
- 该算法在 O(log n) 次迭代内终止,确保在高维情形下的效率。
- 递归阈值更新确保 Δ^(m) 缓慢增长,从而在保持隐私的同时维持准确性。
- 如果任意中间Lipschitz扩展测试失败,测试将返回拒绝,从而在隐私约束下保证正确性。
- 该方法在样本复杂度中对 d 实现了亚线性依赖,使其可扩展至高维数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。