Skip to main content
QUICK REVIEW

[论文解读] Consistent and accurate frequency oracles under local differential privacy

Tianhao Wang, Milan Lopuhaä-Zwakenberg|arXiv (Cornell University)|May 20, 2019
Privacy-Preserving Technologies in Data参考文献 23被引用 17
一句话总结

本文提出后处理技术,通过在估计频率上施加一致性约束(非负性和总和为1)来提升局部差分隐私(LDP)频率预言机的准确性。通过利用这些普遍属性,作者表明,如针对单个值的Base-Cut、针对频繁值的Norm,以及针对子集查询的PowerNS等方法,显著优于基线估计方法,且无单一方法在所有查询类型上均表现最优。

ABSTRACT

Local Differential Privacy (LDP) protects user privacy from the data collector. LDP protocols have been increasingly deployed in the industry. A basic building block is frequency oracle (FO) protocols, which estimate frequencies of values. While several FO protocols have been proposed, their resulting estimations, however, do not satisfy the natural consistency requirement that estimations are non-negative and sum up to 1. In this paper, we study how to add post-processing steps to FO protocols to make them consistent while achieving high accuracy for a wide range of tasks, including frequencies of individual values, frequencies of the most frequent values, and frequencies of subsets of values. We consider 10 different methods, some of them explicitly proposed before in the literature, and others introduced in this paper. We establish theoretical relationships between some of them and conducted extensive experimental evaluations. Among them, we propose to use Norm-Hyb, which keeps estimations above a certain threshold unchanged, and then converts negative estimations to 0 while adding a value (typically negative) to all other estimations to ensure a sum of 1.

研究动机与目标

  • 为解决现有LDP频率预言机协议在应对多样化查询类型时准确性较差的问题,特别是当估计噪声导致负值或不一致的频率估计时。
  • 探究是否通过强制执行普遍的一致性属性(非负频率和总和为1)能显著提升不同查询工作负载下的估计准确性。
  • 识别并评估10种不同的后处理方法,这些方法以不同方式利用这些一致性约束,包括与幂律假设的结合。
  • 为基于目标查询类型的最优后处理方法选择提供实用指导:个体值、频繁值或值的子集。
  • 从理论和实证角度分析不同一致性强制方法引入的偏差与方差之间的权衡及其对查询准确率的影响。

提出的方法

  • 提出10种后处理方法,以强制执行一致性约束:非负性(如Base-Cut)、总和为1(如Norm),或两者兼具(如PowerNS)。
  • 以约束最小二乘法(CLS)和最大似然估计(MLE)作为理论基础,推导在一致性约束下的最优估计器。
  • 将先前工作[17]中的幂律假设与一致性约束相结合,以提升子集查询的准确性,从而提出PowerNS方法。
  • 应用L2距离最小化(如Norm-Sub)和L1距离最小化(如MLE-Apx)以在保持一致性的同时减少估计误差。
  • 将基线LDP协议(如OLH、Hadamard Response)与这些后处理技术相结合,以在合成数据集和真实世界数据集上评估性能。
  • 使用合成数据集指导子集查询的方法选择,因为真实世界数据可能无法揭示最优配置。

实验结果

研究问题

  • RQ1在LDP频率估计中强制执行非负性和总和为1的约束,是否能在多种查询类型中带来显著的准确率提升?
  • RQ2在个体值查询、频繁值查询和子集查询中,不同的一致性强制后处理方法在偏差、方差和准确率方面的表现如何比较?
  • RQ3在LDP约束下,约束最小二乘法与最大似然估计之间存在何种理论关系?
  • RQ4将一致性约束与幂律假设结合(如通过PowerNS)是否能比独立方法在子集频率查询中取得更优性能?
  • RQ5每类查询工作负载的最优后处理方法是什么?能否提供一个基于任务的推荐框架?

主要发现

  • Base-Cut通过将负值估计设为零,在个体值频率查询中实现最佳准确率,其通过减少方差而不引入显著偏差。
  • Norm通过强制总和为1,在估计最频繁值的频率时表现最佳,因其通过全局归一化减少方差。
  • 对于子集频率查询,PowerNS(结合幂律假设与非负性及总和为1约束)达到最高准确率,优于其他方法。
  • 理论分析表明,在噪声近似为高斯分布时,一致性约束下的L2距离最小化近似于最大似然估计,验证了CLS作为实用代理的合理性。
  • 无单一方法在所有查询类型中均优于其他方法;最优方法高度依赖于查询工作负载,因此必须进行任务特定选择。
  • 实证评估证实,基于一致性的后处理能显著提升合成数据集和真实世界数据集上的准确率,尤其在高噪声LDP环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。