Skip to main content
QUICK REVIEW

[论文解读] Metric-based local differential privacy for statistical applications

Mário S. Alvim, Konstantinos Chatzikokolakis|arXiv (Cornell University)|May 3, 2018
Privacy-Preserving Technologies in Data被引用 13
一句话总结

本文提出 $d_{\text{X}}$-privacy,一种基于度量的本地差分隐私(LDP)变体,专为具有内在距离结构的数据(如位置或能耗数据)而设计,通过利用 Kantorovich 提升方法,根据几何邻近性优化噪声分布。在等效隐私预算下,该方法在真实 Gowalla 位置数据上的表现显著优于标准 LDP 机制(如均匀或拉普拉斯机制),预期误差为 450 米。

ABSTRACT

Local differential privacy (LPD) is a distributed variant of differential privacy (DP) in which the obfuscation of the sensitive information is done at the level of the individual records, and in general it is used to sanitize data that are collected for statistical purposes. LPD has the advantage it does not need to assume a trusted third party. On the other hand LDP in general requires more noise than DP to achieve the same level of protection, with negative consequences on the utility. In practice, utility becomes acceptable only on very large collections of data, and this is the reason why LDP is especially successful among big companies such as Apple and Google, which can count on a huge number of users. In this paper, we propose a variant of LDP suitable for metric spaces, such as location data or energy consumption data, and we show that it provides a much better utility for the same level of privacy.

研究动机与目标

  • 解决传统本地差分隐私(LDP)在度量空间(如位置或能耗数据)中带来的高实用性成本问题。
  • 通过在混淆过程中引入领域特定的距离度量,改进 LDP 中的隐私-实用性权衡。
  • 利用 Kantorovich 提升方法,建立 $d_{\text{X}}$-privacy 的正式框架,通过地球移动距离(EMD)建模实用性损失。
  • 在真实世界的位置签到数据(Gowalla 数据集)上对所提机制进行实证评估。
  • 证明基于度量的噪声注入在空间应用中显著优于均匀或拉普拉斯噪声的实用性。

提出的方法

  • 将 $d_{\text{X}}$-privacy 定义为 LDP 的推广形式,其中隐私保证基于数据域上的度量 $d_{\mathcal{X}}$,而非基于单个数值。
  • 使用 Kantorovich 提升方法,将预期实用性损失计算为真实分布与报告分布之间的地球移动距离(EMD)。
  • 设计三种机制:均匀(均匀)、几何和离散化拉普拉斯,均调校至实现相同的预期误差(450 米)以确保公平比较。
  • 将实用性损失建模为在真实分布 $\pi$ 与报告分布 $\Delta = \mathscr{M}(\pi)$ 之间的耦合上的最小化问题,使用 $K(d_{\mathcal{X}})$ 作为 Wasserstein 距离。
  • 校准每种机制的隐私参数 $\varepsilon$,以确保从真实位置出发的期望距离 $Ed = 450$ 米。
  • 在巴黎市中心 30×30 网格(每个格子 150m×150m)的 750 条 Gowalla 签到记录数据集上逐步评估性能。

实验结果

研究问题

  • RQ1基于度量的 LDP 机制是否能在不牺牲隐私的前提下,提升空间数据采集中的实用性?
  • RQ2当数据域具有自然距离结构时,噪声分布的选择(均匀 vs. 几何 vs. 拉普拉斯)如何影响 LDP 的实用性?
  • RQ3将噪声分布与底层度量 $d_{\mathcal{X}}$ 对齐,在位置报告中能在多大程度上降低预期误差?
  • RQ4在真实世界的空间数据中,$d_{\text{X}}$-私有机制的实用性如何随数据集规模增大而变化?

主要发现

  • 几何和离散化拉普拉斯机制在相同预期误差(450 米)下,显著优于均匀机制。
  • 由于均匀噪声在整个数据域上均匀分布,均匀机制在小数据集(<2000 条签到)中表现出高不稳定性与缓慢收敛的实用性损失。
  • 几何和离散化拉普拉斯机制对远处格子分配了可忽略的概率,从而最小化了其对实用性损失的贡献,这与数据的度量结构一致。
  • 均匀机制的实用性损失随数据集规模增加而缓慢下降,而几何和拉普拉斯机制则表现出稳定且快速的收敛。
  • 为实现相同预期误差,均匀机制所需的隐私参数 $\varepsilon \approx 8.25$,远高于几何($\varepsilon \approx 0.004$)和拉普拉斯($\varepsilon \approx 0.004$)机制,表明其隐私-实用性权衡差得多。
  • 实验结果证实,$d_{\text{X}}$-privacy 在度量空间中,尤其是在位置签到等空间数据中,提供了更优的隐私-实用性权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。