Skip to main content
QUICK REVIEW

[论文解读] WaveCluster with Differential Privacy

Ling Chen, Ting Yu|arXiv (Cornell University)|Aug 2, 2015
Privacy-Preserving Technologies in Data被引用 6
一句话总结

本文提出了PrivTHR和PrivTHR EM两种优化的差分隐私技术,用于WaveCluster算法,在量化和显著网格识别过程中减少噪声,显著提升聚类效用。这些方法在低隐私预算下实现高精度,优于多种数据集上的基线合成数据方法。

ABSTRACT

WaveCluster is an important family of grid-based clustering algorithms that are capable of finding clusters of arbitrary shapes. In this paper, we investigate techniques to perform WaveCluster while ensuring differential privacy. Our goal is to develop a general technique for achieving differential privacy on WaveCluster that accommodates different wavelet transforms. We show that straightforward techniques based on synthetic data generation and introduction of random noise when quantizing the data, though generally preserving the distribution of data, often introduce too much noise to preserve useful clusters. We then propose two optimized techniques, PrivTHR and PrivTHREM, which can significantly reduce data distortion during two key steps of WaveCluster: the quantization step and the significant grid identification step. We conduct extensive experiments based on four datasets that are particularly interesting in the context of clustering, and show that PrivTHR and PrivTHREM achieve high utility when privacy budgets are properly allocated.

研究动机与目标

  • 解决在WaveCluster(一种用于检测任意形状聚类的基于网格的算法)中,在确保差分隐私的同时保持聚类效用的挑战。
  • 克服现有合成数据生成方法的局限性,这些方法因噪声负计数而扭曲数据分布并合并聚类。
  • 开发一种通用的、与小波变换无关的WaveCluster差分隐私技术,适用于各种小波变换。
  • 通过优化量化与显著网格识别步骤之间的隐私预算分配,提升聚类效用。
  • 提出新的评估指标——OCM与2CE,以更准确地评估私有聚类与非私有聚类结果之间的相似性。

提出的方法

  • 提出PrivTHR,一种通过拉普拉斯噪声对WaveCluster的量化步骤直接应用差分隐私的技术,并优化隐私预算分配。
  • 通过迭代的EM-like优化步骤(PrivTHR EM)增强PrivTHR,以改进显著网格识别过程,提升聚类恢复能力。
  • 采用两阶段隐私预算分配策略:基于敏感性分析,将更多预算(90%)分配给量化(影响γ),少部分(10%)分配给显著网格检测(影响β)。
  • 在WaveCluster的核心计算步骤——量化与显著网格识别——中应用差分隐私,而非依赖合成数据生成。
  • 利用小波变换(如Haar、Biorthogonal)将数据转换到聚类更易区分的空间,在隐私约束下保留形状信息。
  • 引入OCM(Overall Cluster Matching)与2CE(Two-Class Error)作为新型评估指标,用于评估私有与真实聚类结果之间在类别映射与成对数据点关系方面的相似性。

实验结果

研究问题

  • RQ1是否可以有效将差分隐私应用于WaveCluster,而无需依赖合成数据生成,后者常导致数据分布扭曲并合并聚类?
  • RQ2如何在WaveCluster的量化与显著网格识别步骤之间最优分配隐私预算,以最大化聚类效用?
  • RQ3PrivTHR与PrivTHR EM是否在相同隐私预算下,优于基线方法(如自适应网格的合成数据生成)在聚类准确率与效用方面?
  • RQ4所提出的评估指标OCM与2CE在多大程度上比传统F-measure更真实地反映私有与非私有聚类结果之间的相似性?
  • RQ5PrivTHR与PrivTHR EM在不同聚类形状(如螺旋形、凹形)和大小的数据集上的性能表现如何?

主要发现

  • 当ε > 0.5时,PrivTHR与PrivTHR EM在DS1、DS3和Gowalla上的OCM值均低于0.15,表明私有聚类与真实聚类结果高度相似。
  • 在DS2(三个螺旋形聚类)上,PrivTHR EM在ε > 0.5时保持OCM < 0.1,表明其在凹形聚类中对噪声具有更强的鲁棒性,优于PrivTHR。
  • 所有四种技术(PrivTHR、PrivTHR EM、Baseline、PrivQT)在2CE与OCM上的趋势相似,但2CE在DS1等大规模数据集上对噪声不那么敏感,因其具有组合归一化特性。
  • 基于敏感性分析与效用评估,PrivTHR的最优隐私预算分配为:量化步骤(ε₁)分配90%,显著网格检测步骤(ε₂)分配10%。
  • 基线合成数据生成方法(自适应网格)因负计数被设为零,导致显著的数据失真,将两个独立聚类合并为一个,如图2所示。
  • 在所有数据集(DS1、DS2、DS3、Gowalla)上,对于ε ∈ [0.5, 2.0],PrivTHR与PrivTHR EM在OCM与2CE上均持续优于Baseline与PrivQT。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。