[论文解读] A Data- and Workload-Aware Algorithm for Range Queries Under Differential Privacy
本文提出DAWA,一种用于范围查询的两阶段差分隐私算法,通过自适应地划分数据域并调节噪声规模以匹配数据分布和工作负载,实现显著更低的误差。通过结合数据感知的划分与工作负载感知的噪声分配,DAWA在简单数据集上相比最先进方法误差降低高达6.86倍,同时在复杂数据集上保持与数据无关方法相当的性能。
We describe a new algorithm for answering a given set of range queries under $ε$-differential privacy which often achieves substantially lower error than competing methods. Our algorithm satisfies differential privacy by adding noise that is adapted to the input data and to the given query set. We first privately learn a partitioning of the domain into buckets that suit the input data well. Then we privately estimate counts for each bucket, doing so in a manner well-suited for the given query set. Since the performance of the algorithm depends on the input database, we evaluate it on a wide range of real datasets, showing that we can achieve the benefits of data-dependence on both "easy" and "hard" databases.
研究动机与目标
- 解决现有差分隐私机制的局限性:要么忽略数据结构(数据无关),要么在复杂、非均匀数据集上失效(数据相关)。
- 设计一种机制,利用数据结构降低误差,同时在难以利用的数据集上不牺牲性能。
- 将工作负载感知的噪声分配整合到数据感知的划分框架中,以提升范围查询工作负载的准确性。
- 设计一种计算高效的差分隐私划分算法,能够自适应数据均匀性并自动选择最优桶数。
- 在数据相关精度增益与跨多样化数据分布的鲁棒性之间取得平衡,尤其在现实场景中数据属性事先未知的情况下。
提出的方法
- 使用一种新颖的差分隐私算法,利用ε₁的隐私预算将数据域划分为近似均匀的区域,通过最小化基于L1偏离均匀性的代价函数实现。
- 在第二阶段采用分层查询策略,利用ε₂的预算为不同粒度级别的范围查询计算噪声缩放因子。
- 在相同分层级别上对查询实施非均匀的预算分配,实现针对特定工作负载的精细化噪声分配。
- 利用工作负载的结构特征指导噪声分配,通过优先处理对整体误差贡献最大的查询来提升准确性。
- 通过将隐私预算划分为ε₁用于划分和ε₂用于查询估计,确保整体ε-差分隐私,形式化隐私保障基于组合定理。
- 通过分层测量系统实现桶计数的私有估计,结合噪声答案与最小二乘推理,生成一致的估计结果。

实验结果
研究问题
- RQ1差分隐私机制是否能在多样化的真实世界数据集上,显著降低现有数据无关与数据相关方法的误差?
- RQ2如何将数据感知划分与工作负载感知噪声分配相结合,以在差分隐私下提升范围查询的准确性?
- RQ3数据相关机制在复杂、非均匀数据集上的性能退化程度如何?是否可被缓解?
- RQ4在分层查询中采用自适应、非均匀的噪声分配对整体工作负载误差有何影响?
- RQ5机制是否能自动选择最优分区数量,而无需用户指定如k之类的参数?
主要发现
- 在具有大块均匀区域的数据集上,DAWA相比最先进数据相关方法MWEM,将平均每个查询的误差降低了高达6.86倍。
- 在复杂数据集(如HEP-PH引文网络)上,DAWA在ε=0.1时的平均每个查询误差为722.3,与数据无关的Privelet机制的196.6误差水平相当。
- 在IP级网络追踪数据集上,DAWA相比数据无关的Privelet机制误差降低3.27倍,表明在具有可利用结构的真实数据上具有显著优势。
- 私有划分算法生成的分区质量优于现有方法(如P-HP和StructureFirst),在均匀性与代价方面表现更优,且运行时间接近线性。
- DAWA的工作负载感知噪声分配支持在相同分层级别上实现非均匀的预算分配,从而相比均匀分配策略获得更精确的估计。
- 该机制实现了两全其美:在简单数据集上实现高精度,在复杂数据集上保持稳健性能,且无需事先了解数据复杂度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。