[论文解读] Distributed Clustering in the Anonymized Space with Local Differential Privacy
该论文提出了一种基于改进的位向量(DPBV)编码机制的隐私保护分布式聚类框架,该机制可在匿名化的汉明空间中实现本地差分隐私(LDP)。通过在匿名化空间中保留距离信息,kCluster算法能够在分布式、噪声大且不完整的数据上实现有效聚类,同时确保$(\epsilon,\delta)$-LDP保证,且在$\epsilon \geq 1$时实现高实用性。该方法支持无需可信聚合方的非交互式多参与方便聚类。
Clustering and analyzing on collected data can improve user experiences and quality of services in big data, IoT applications. However, directly releasing original data brings potential privacy concerns, which raises challenges and opportunities for privacy-preserving clustering. In this paper, we study the problem of non-interactive clustering in distributed setting under the framework of local differential privacy. We first extend the Bit Vector, a novel anonymization mechanism to be functionality-capable and privacy-preserving. Based on the modified encoding mechanism, we propose kCluster algorithm that can be used for clustering in the anonymized space. We show the modified encoding mechanism can be easily implemented in existing clustering algorithms that only rely on distance information, such as DBSCAN. Theoretical analysis and experimental results validate the effectiveness of the proposed schemes.
研究动机与目标
- 为解决稀疏、不完整且具有个人属性的数据在分布式聚类中的隐私泄露问题。
- 在本地差分隐私(LDP)下实现无需交互的多参与方便聚类。
- 将位向量机制扩展以支持聚类,通过在匿名化空间中保留距离信息。
- 通过$(\epsilon,\delta)$-LDP确保强隐私保障,同时保持聚类的实用性。
- 设计一种仅依赖匿名化空间中距离信息的聚类算法。
提出的方法
- 将位向量(BV)机制扩展为差分隐私版本(DPBV),将标量值映射到汉明空间中的位向量。
- 通过向每个位向量添加噪声,实现本地差分隐私,确保原始值的不可区分性。
- 使用配置参数$s$控制隐私预算$\epsilon$和$\delta$,其中$s = \lceil \frac{\ln \delta}{\epsilon - \ln(e^\epsilon + 1)} \rceil$。
- 采用距离感知的编码策略,使原始空间中的欧氏距离在汉明空间中近似保留。
- 设计kCluster算法,仅使用从匿名化位向量计算出的距离矩阵执行聚类。
- 通过仅依赖距离信息,支持与现有基于距离的聚类算法(如DBSCAN)的集成。
实验结果
研究问题
- RQ1能否设计一种本地差分隐私机制,使匿名化空间中的距离信息得以保留,以支持聚类?
- RQ2如何在LDP保证下,于非交互式多参与方便的分布式聚类中实现聚类?
- RQ3在匿名化空间中,隐私($\epsilon, \delta$)与聚类实用性之间的权衡如何?
- RQ4改进的位向量机制能否在防止重新识别的同时支持复杂分析(如聚类)?
- RQ5是否可能在距离感知的匿名化机制中实现$\epsilon$-LDP,还是必须采用$\delta$-松弛?
主要发现
- 所提出的DPBV机制通过扩展匿名化空间并添加校准噪声,实现了$(\epsilon,\delta)$-本地差分隐私。
- 当$\epsilon \geq 1$时,kCluster算法表现出高聚类实用性,多轮运行结果稳定。
- 位向量长度$s$随隐私要求提高($\delta$降低)或更强$\epsilon$保证而增加。
- 当$\epsilon = 1$时,不同输入(如$x=24.3$与$x=26.2$)的输出概率分布几乎无法区分,确保了隐私性。
- 当$s$较大时,即使攻击者完全掌握配置参数,也无法可靠地重新识别原始值,因为每个值的输出概率极低。
- 若攻击者同时获知原始数据及其对应的位向量,则该方法易受共谋攻击,因距离信息可被用于恢复原始值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。