[论文解读] Instance-optimal Mean Estimation Under Differential Privacy
本文提出了一种实例最优的差分隐私均值估计机制,该机制可自适应数据特征而无需参数调优,对内邻集(仅通过替换原始集合中已有向量而不同的数据集)实现最优误差界。该方法基于范数分位数和高斯噪声设计数据驱动的截断阈值,在真实数据(包括MNIST和高维正态分布)上优于以往的启发式方法和最坏情况最优机制。
Mean estimation under differential privacy is a fundamental problem, but worst-case optimal mechanisms do not offer meaningful utility guarantees in practice when the global sensitivity is very large. Instead, various heuristics have been proposed to reduce the error on real-world data that do not resemble the worst-case instance. This paper takes a principled approach, yielding a mechanism that is instance-optimal in a strong sense. In addition to its theoretical optimality, the mechanism is also simple and practical, and adapts to a variety of data characteristics without the need of parameter tuning. It easily extends to the local and shuffle model as well.
研究动机与目标
- 解决最坏情况最优差分隐私均值估计器的实际局限性,后者因对坐标值采用保守界而导致全局敏感度较大时误差过高。
- 通过提供一种有理论依据的、系统化的方法选择截断阈值,克服启发式截断方法(如固定分位数截断)的不足。
- 引入一种新的实例最优性概念——聚焦于内邻集,即仅通过替换已有向量而不同的数据集,从而提供更强且更实用的效用保证。
- 设计一种在新准则下理论最优且在各类数据分布(包括非高斯和高维数据)中均具实际有效性的机制。
- 将该机制扩展至本地模型和洗牌模型,证明其在去中心化和通信受限环境下的鲁棒性与可扩展性。
提出的方法
- 基于内邻集提出新的实例最优性概念:邻近数据集仅通过替换已有向量构成,而非任意替换。
- 将目标误差定义为所有DP机制中,在任意内邻集数据集上以恒定概率(2/3)可实现的最小误差的下确界。
- 设计一种机制,使其误差在该目标误差的常数倍以内,从而在内邻集定义下实现实例最优性。
- 采用数据自适应的截断阈值:向量范数的$(n - \sqrt{2d/\rho})$-分位数,其依赖于维度$d$和隐私参数$\rho$,以在保护隐私的同时最小化噪声。
- 应用零集中差分隐私(zCDP),并使用与截断数据局部敏感度成比例的高斯噪声,确保隐私与效用之间的权衡。
- 通过逐坐标应用并利用高级组合性质组合隐私保证,将该机制扩展至本地模型,同时通过数据中心化保持平移不变性。
实验结果
研究问题
- RQ1我们能否设计一种差分隐私均值估计器,使其在全局敏感度较大但实际数据变化较小时,对真实世界数据集实现最优效用?
- RQ2是否存在一种有原则的方法来选择差分隐私均值估计中的截断阈值,使其能自适应数据结构而无需人工调优?
- RQ3是否存在一种强于最坏情况最优性但仍在实践中可实现的实例最优性概念,特别是针对均值估计?
- RQ4这种实例最优机制能否在不牺牲效用的前提下扩展至本地模型和洗牌模型?
- RQ5所提出方法在真实世界和合成数据集上与现有启发式方法及SOTA方法(如COINPRESS)相比,其表现如何?
主要发现
- 所提机制在内邻集定义下实现了实例最优性,保证其误差始终在任意内邻集数据集最优可能误差的常数倍以内。
- 在MNIST数据集上,该方法在所有隐私级别($\rho = 0.1, 0.5, 1$)下均优于COINPRESS,表明其对非高斯数据分布具有强鲁棒性。
- 最优截断阈值依赖于$d$和$\rho$,所提出的基于分位数的选择方法($n - \sqrt{2d/\rho}$-分位数)相比固定分位数启发式方法显著降低了误差。
- 在本地模型中,该方法甚至优于COINPRESS的KnownVar版本(假设已知方差),表明其在去中心化环境中具有强大效用。
- 该机制具有平移不变性:数据中心的移动不会影响性能,而非常中心化方法则会受影响,这证实了其对数据位置的鲁棒性。
- 在高维($d=128$)情况下,与先前方法相比,维度带来的误差增益更小,且在协方差估计失败时仍能保持良好性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。