[论文解读] Differentially private multivariate medians
本论文为在不同差分隐私下使用深度函数进行多变量中位数估计的指数机制提出了一种新型浓度不等式。在最小分布假设下,建立了基于深度的中位数(如Tukey、空间和积分对偶深度)的精确有限样本样本复杂度边界,表明在柯西等重尾分布下,隐私成本可忽略不计。
Statistical tools which satisfy rigorous privacy guarantees are necessary for modern data analysis. It is well-known that robustness against contamination is linked to differential privacy. Despite this fact, using multivariate medians for differentially private and robust multivariate location estimation has not been systematically studied. We develop novel finite-sample performance guarantees for differentially private multivariate depth-based medians, which are essentially sharp. Our results cover commonly used depth functions, such as the halfspace (or Tukey) depth, spatial depth, and the integrated dual depth. We show that under Cauchy marginals, the cost of heavy-tailed location estimation outweighs the cost of privacy. We demonstrate our results numerically using a Gaussian contamination model in dimensions up to $d = 100$, and compare them to a state-of-the-art private mean estimation algorithm. As a by-product of our investigation, we prove concentration inequalities for the output of the exponential mechanism about the maximizer of the population objective function. This bound applies to objective functions that satisfy a mild regularity condition.
研究动机与目标
- 解决不同差分隐私多变量中位数估计在有限样本下缺乏性能保证的问题,特别是针对鲁棒的基于深度的中位数。
- 填补在重尾或污染模型中,与均值估计相比,多变量位置估计中隐私成本理解的空白。
- 提出一个通用的正则性条件——(K, F)-正则性,以实现多变量设置下指数机制的样本复杂度边界。
- 证明在重尾分布(如柯西分布)下,隐私成本可忽略不计,此时鲁棒性优于隐私开销。
- 为高维(高达 d=100)提供一个具有可证明准确性和计算可行性的私有基于深度的中位数估计实用框架。
提出的方法
- 提出一种新的正则性条件 (K, F)-正则性,以控制指数机制中的全局敏感度和样本复杂度。
- 在温和的正则性和连续性假设下,推导出指数机制输出围绕目标函数总体最大化值的浓度不等式。
- 将指数机制应用于深度函数(如Tukey、空间、积分对偶深度),将深度最大化者视为多变量中位数。
- 利用VC理论和拉普拉斯机制,限制私有深度值与其总体对应值之间的偏差,从而获得高概率误差边界。
- 采用一种私有采样策略来获取样本点处的深度值,承认完整向量发布因信息泄露而需添加大量噪声。
- 通过高达 d=100 的高斯污染模型对结果进行数值验证,与最先进的私有均值估计器进行比较。
实验结果
研究问题
- RQ1通过深度函数进行不同差分隐私多变量中位数估计的有限样本样本复杂度是多少?
- RQ2在柯西等重尾分布中,隐私成本与鲁棒性成本相比如何?
- RQ3(K, F)-正则性能否用于推导多变量设置下指数机制的精确样本复杂度边界?
- RQ4在差分隐私下对样本点处的深度值进行估计时,隐私与准确性的权衡如何?
- RQ5在高维、污染或重尾数据中,私有基于深度的中位数与私有均值估计器相比表现如何?
主要发现
- 所提出的 (K, F)-正则性条件使基于深度的中位数的样本复杂度边界达到 O(d log d),与已知的私有高斯均值估计的下界在对数因子内一致。
- 对于柯西分布数据,鲁棒性成本(即使用中位数)远高于隐私成本,意味着在此类设置下隐私噪声可忽略不计。
- 利用VC理论和拉普拉斯机制,推导出私有深度值的有限样本误差边界,获得高概率集中性:Pr(|D̃(x, μ̂n) - D(x, μ)| > t) ≤ (c1n/VC(F))^VC(F) e^{-c2nt²/K²} + e^{-nεt/2K}。
- 私有基于深度的中位数的样本复杂度本质上是精确的,经与Kamath等人(2020)关于私有均值估计的下界比较得到验证。
- 由于信息泄露过高,对样本点处完整深度值向量的私有估计不可行,所需噪声水平超过抽样误差。
- 一个实用的替代方案是使用小 ε 值对 N 个私有中位数点进行采样,从而在不发布完整向量的前提下支持下游推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。