Skip to main content
QUICK REVIEW

[论文解读] Propose, Test, Release: Differentially private estimation with high probability

Victor-Emmanuel Brunel, Marco Avella-Medina|arXiv (Cornell University)|Feb 19, 2020
Privacy-Preserving Technologies in Data参考文献 28被引用 13
一句话总结

本文提出了一种改进的“提议、测试、发布”(PTR)机制,用于对中位数和均值进行差分隐私估计,实现了无需假设数据有界或参数区间已知的次高斯高概率误差界。该方法在一般矩条件(包括重尾分布)下,首次为差分隐私中位数和均值估计器提供了次高斯偏离保证。

ABSTRACT

We derive concentration inequalities for differentially private median and mean estimators building on the "Propose, Test, Release" (PTR) mechanism introduced by Dwork and Lei (2009). We introduce a new general version of the PTR mechanism that allows us to derive high probability error bounds for differentially private estimators. Our algorithms provide the first statistical guarantees for differentially private estimation of the median and mean without any boundedness assumptions on the data, and without assuming that the target population parameter lies in some known bounded interval. Our procedures do not rely on any truncation of the data and provide the first sub-Gaussian high probability bounds for differentially private median and mean estimation, for possibly heavy tailed random variables.

研究动机与目标

  • 解决在缺乏有界数据或参数区间已知条件时,差分隐私中位数与均值估计器缺乏高概率误差界的问题。
  • 克服现有差分隐私估计器依赖数据截断或参数边界先验知识的局限性。
  • 在最小矩假设下(包括重尾分布),为差分隐私均值与中位数估计提供次高斯偏离保证。
  • 设计一种通用且紧致的PTR机制版本,以最小化噪声,同时控制测试阶段“无回复”事件的概率。
  • 在不依赖最坏情况噪声校准的前提下,建立差分隐私估计器的有限样本高概率误差界。

提出的方法

  • 引入一种广义且改进的“提议、测试、发布”(PTR)机制,根据数据配置自适应校准噪声。
  • 以“均值的中位数”估计器为基础,将数据划分为K个互不相交的块,以计算经验均值。
  • 对经验均值应用PTR机制,以检验数据配置是否允许低噪声估计。
  • 利用集中极限不等式和样本均值正态近似下的Berry-Esseen界,控制“无回复”事件的概率。
  • 利用顺序统计量和均匀间距(uniform spacings)来界定中位数的均值周围置信区间的宽度,确保高概率准确性。
  • 结合Hoeffding不等式与Bernstein不等式,以及经验中位数的集中界,推导出次高斯偏离界。

实验结果

研究问题

  • RQ1差分隐私中位数与均值估计器是否能在不假设数据有界或参数区间已知的条件下,实现次高斯高概率误差界?
  • RQ2能否设计一种差分隐私均值估计器,在仅具备二阶矩假设下仍保持次高斯偏离特性?
  • RQ3如何改进PTR机制,以在确保高概率准确性的同时最小化噪声并控制失败概率?
  • RQ4能否将“均值的中位数”估计器适配至差分隐私框架,并为重尾分布提供次高斯误差保证?
  • RQ5在差分隐私位置估计中,噪声水平、失败概率与样本复杂度之间的最优权衡是什么?

主要发现

  • 所提出的PTR机制在无需有界数据或参数位置先验知识的条件下,实现了差分隐私中位数与均值估计的次高斯高概率误差界。
  • 对于“均值的中位数”估计器,该方法确保误差超过次高斯阈值的概率被控制在τ以内,即使底层分布仅有两个有限矩。
  • 通过结合顺序统计量与均匀间距的集中界,该算法将失败概率控制在τ/2以内,前提是经验均值的第k个顺序统计量位于可控区间内。
  • 噪声水平实现自适应校准:当数据配置有利时,仅添加少量噪声,显著优于最坏情况机制的准确性。
  • 该方法要求样本量满足 n ≥ 33(ρ/σ)^6K,以确保所需的高概率界,其中ρ为峰度,σ为标准差。
  • 最终估计器对均值与中位数的次高斯偏离界达到 O(√(log(1/τ)/n)) 的量级,与非私有情况下的次高斯率一致,且在最小矩假设下成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。