Skip to main content
QUICK REVIEW

[论文解读] Locally Private Mean Estimation: Z-test and Tight Confidence Intervals

Marco Gaboardi, Ryan Rogers|arXiv (Cornell University)|Oct 18, 2018
Privacy-Preserving Technologies in Data被引用 18
一句话总结

该论文在高斯假设下提出了均值估计的最优局部差分隐私算法,通过结合位翻转机制与二分查找进行分位数估计,实现了长度为 $\widetilde{O}\left(\frac{\sigma\sqrt{\log(1/\beta)}}{\epsilon\sqrt{n}}\right)$ 的紧置信区间。该工作建立了匹配的上下界(最多相差多对数因子),证明了在局部模型中该区间长度的最优性。

ABSTRACT

This work provides tight upper- and lower-bounds for the problem of mean estimation under $ε$-differential privacy in the local model, when the input is composed of $n$ i.i.d. drawn samples from a normal distribution with variance $σ$. Our algorithms result in a $(1-β)$-confidence interval for the underlying distribution's mean $μ$ of length $ ilde O\left( \frac{σ\sqrt{\log(\frac 1 β)}}{ε\sqrt n} ight)$. In addition, our algorithms leverage binary search using local differential privacy for quantile estimation, a result which may be of separate interest. Moreover, we prove a matching lower-bound (up to poly-log factors), showing that any one-shot (each individual is presented with a single query) local differentially private algorithm must return an interval of length $Ω\left( \frac{σ\sqrt{\log(1/β)}}{ε\sqrt{n}} ight)$.

研究动机与目标

  • 为在高斯数据下局部差分隐私均值估计的上下界差距提供填补。
  • 设计高效的一次性 LDP 算法,生成接近最小长度的置信区间。
  • 在局部模型中提供经典 Z 检验的私有对应版本,实现在隐私约束下的假设检验。
  • 证明所推导的置信区间长度在多对数因子范围内是最优的。
  • 为局部差分隐私在私有分位数估计中的新颖应用,该应用可能具有独立意义。

提出的方法

  • 利用位翻转机制识别一个包含真实均值的狭窄区间,其概率较高,利用了均值位于长度为 $\sigma$ 的最频繁区间的 $2\sigma$ 范围内的事实。
  • 在离散化区间 $[-R, R]$ 上使用二分查找进行私有分位数估计,通过精心构造的分布族来模拟分位数查询。
  • 对裁剪并投影后的数据点应用带有校准高斯噪声 $\mathcal{N}\left(0, \frac{2|I|^2 \log(2/\delta)}{\epsilon^2}\right)$ 的私有平均机制,以估计均值。
  • 构建一个包含三个点的离散分布族 $\mathcal{P}_i$,通过总变差距离和隐私放大效应来证明下界。
  • 结合 $\epsilon$-LDP 与 $\delta$-松弛的混合隐私分析方法,推导出样本复杂度与误差的紧界。
  • 应用浓度不等式与隐私损失会计方法,限制分位数估计与区间恢复中的错误概率。

实验结果

研究问题

  • RQ1我们能否设计一种局部差分隐私算法,使得均值的置信区间长度达到 $\widetilde{O}\left(\frac{\sigma\sqrt{\log(1/\beta)}}{\epsilon\sqrt{n}}\right)$?
  • RQ2该区间长度在局部模型中是否在多对数因子范围内最优?
  • RQ3基于二分查找的私有分位数估计能否作为私有均值估计的构建模块?
  • RQ4在置信区间长度方面,一次性局部差分隐私均值估计的根本极限是什么?
  • RQ5已知方差与未知方差的情形如何影响私有统计推断中的效用与隐私权衡?

主要发现

  • 在已知方差情况下,所提算法在满足 $n = \Omega\left(\frac{\log(R/\sigma)}{\epsilon^2}\right)$ 条件下,实现了长度为 $O\left(\frac{\sigma\sqrt{\log(n)}}{\epsilon\sqrt{n}}\right)$ 的置信区间。
  • 在未知方差情况下,若已知 $\sigma$ 的下界,算法仍能生成长度相近的有效置信区间。
  • 证明了对任意一次性 $\epsilon$-LDP 算法,其下界为 $\Omega\left(\frac{\sigma\sqrt{\log(1/\beta)}}{\epsilon\sqrt{n}}\right)$,表明其在多对数因子范围内达到最优。
  • 私有 Z 检验经实证验证,展示了置信区间的实际效用与紧致性。
  • 基于二分查找的分位数估计技术被证明有效,可能在其他 LDP 应用中具有独立价值。
  • 下界证明表明,$\alpha_{\rm quant}$ 与 $\alpha_{\rm dist}$ 参数在构造中均不可或缺,若省略任一参数,将导致样本复杂度无界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。