[论文解读] Context-Aware Local Differential Privacy
本文提出了一种上下文感知的局部差分隐私(LDP)框架,根据数据敏感度分配可变的隐私预算,从而在分布估计中提升实用性。对于二元域,该框架提供了普遍最优的随机化机制;对于 $k$-ary 域,提出了分块结构化和高低 LDP 模型,表明上下文感知的 LDP 能够降低样本复杂度并提升准确性,尤其在地理位置和网络浏览等应用中表现更优。
Local differential privacy (LDP) is a strong notion of privacy for individual users that often comes at the expense of a significant drop in utility. The classical definition of LDP assumes that all elements in the data domain are equally sensitive. However, in many applications, some symbols are more sensitive than others. This work proposes a context-aware framework of local differential privacy that allows a privacy designer to incorporate the application's context into the privacy definition. For binary data domains, we provide a universally optimal privatization scheme and highlight its connections to Warner's randomized response (RR) and Mangat's improved response. Motivated by geolocation and web search applications, for $k$-ary data domains, we consider two special cases of context-aware LDP: block-structured LDP and high-low LDP. We study discrete distribution estimation and provide communication-efficient, sample-optimal schemes and information-theoretic lower bounds for both models. We show that using contextual information can require fewer samples than classical LDP to achieve the same accuracy.
研究动机与目标
- 为解决经典局部差分隐私(LDP)中因将所有数据元素视为同等敏感而带来的高实用性代价,即使某些数据更私密。
- 构建一个统一的上下文感知 LDP 框架,使隐私参数可根据应用特定的上下文(如数据敏感度或结构)而变化。
- 刻画在两种实用模型——分块结构化 LDP 和高低 LDP——下,随机化与估计方案的样本复杂度和通信效率。
- 证明引入上下文信息可减少实现给定估计精度所需的样本数量,相较于经典 LDP 有显著优势。
提出的方法
- 提出一种通用的上下文感知 LDP 定义,其中隐私损失界限按域元素对定义,允许任意敏感度水平。
- 针对二元域,推导出一种普遍最优的随机化机制,可插值于 Warner 的随机响应与 Mangat 的改进响应之间。
- 引入分块结构化 LDP,将数据域划分为若干块,仅保护块内身份,适用于地理位置和人口普查数据等场景。
- 引入高低 LDP,仅对部分敏感元素施加保护,适用于网络浏览中敏感与非敏感 URL 混合的场景。
- 为两种模型设计通信与计算高效的随机化与估计方案,并提供样本复杂度的理论保证。
- 采用信息论下界与卡方散度分析,建立上下文感知 LDP 下估计误差的紧致边界。
实验结果
研究问题
- RQ1通过利用数据敏感度,上下文感知的 LDP 框架是否能降低分布估计的样本复杂度,相较于经典 LDP?
- RQ2在上下文感知 LDP 下,二元域的最优随机化机制是什么?其与 Warner 和 Mangat 响应等现有方法有何关系?
- RQ3分块结构化 LDP 如何在地理位置等应用中提升实用性,其中仅需隐藏城市内的精确位置?
- RQ4在仅部分元素敏感的高低 LDP 模型下,分布估计的理论样本复杂度是多少?
- RQ5在真实数据集(如 Gowalla 检查点)中,相较于经典 LDP,上下文感知 LDP 在实用性方面提升了多少?
主要发现
- 对于二元域,所提出的普遍最优随机化机制实现了隐私与实用性的最佳权衡,可统一 Warner 和 Mangat 的响应方法。
- 在分块结构化 LDP 下,$k$-ary 分布估计的样本复杂度显著低于经典 LDP,尤其当块数 $m$ 增加时更为明显。
- 在 $k=1000$、$\varepsilon=1$、$m=100$ 的合成实验中,分块结构化 LDP 的 $d_{TV}$ 误差为 0.082,而经典 LDP 下为 0.591。
- 在包含 $43,750$ 个位置的 Gowalla 数据集中,分块结构化 LDP 将 $d_{TV}$ 误差从经典 LDP 的 0.591 降低至 0.082($m_1=25, m_2=70$)。
- 理论分析表明,分块结构化 LDP 的样本复杂度为 $\Theta\left(\frac{\sum k_i^2}{\alpha^2 \varepsilon^2}\right)$,当块较小时,其低于经典 LDP 的 $\Theta\left(\frac{k^2}{\alpha^2 \varepsilon^2}\right)$。
- 实验结果证实,增加块数(即更细粒度的划分)可提升估计精度,验证了上下文感知 LDP 的理论优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。