Skip to main content
QUICK REVIEW

[论文解读] Secure and Utility-Aware Data Collection with Condensed Local Differential Privacy

Mehmet Emre Gürsoy, Acar Tamersoy|arXiv (Cornell University)|May 15, 2019
Privacy-Preserving Technologies in Data参考文献 44被引用 15
一句话总结

本文提出了一种新型隐私保护框架——凝聚局部差分隐私(CLDP),通过使用凝聚概率分布以偏好相似扰动输出的方式,显著提升了小用户群体下的数据实用性。作者提出了序数-CLDP、项目-CLDP 和序列-CLDP 协议,在小规模用户群体及序列数据场景下,相比现有局部差分隐私(LDP)方法实现了显著更高的准确性,同时保护了序列内容与长度的隐私。

ABSTRACT

Local Differential Privacy (LDP) is popularly used in practice for privacy-preserving data collection. Although existing LDP protocols offer high utility for large user populations (100,000 or more users), they perform poorly in scenarios with small user populations (such as those in the cybersecurity domain) and lack perturbation mechanisms that are effective for both ordinal and non-ordinal item sequences while protecting sequence length and content simultaneously. In this paper, we address the small user population problem by introducing the concept of Condensed Local Differential Privacy (CLDP) as a specialization of LDP, and develop a suite of CLDP protocols that offer desirable statistical utility while preserving privacy. Our protocols support different types of client data, ranging from ordinal data types in finite metric spaces (numeric malware infection statistics), to non-ordinal items (OS versions, transaction categories), and to sequences of ordinal and non-ordinal items. Extensive experiments are conducted on multiple datasets, including datasets that are an order of magnitude smaller than those used in existing approaches, which show that proposed CLDP protocols yield high utility. Furthermore, case studies with Symantec datasets demonstrate that our protocols accurately support key cybersecurity-focused tasks of detecting ransomware outbreaks, identifying targeted and vulnerable OSs, and inspecting suspicious activities on infected machines.

研究动机与目标

  • 解决现有局部差分隐私(LDP)协议在小用户群体中实用性差的问题,此类问题在网络安全场景中普遍存在。
  • 克服当前LDP方案无法同时对包含序数与非序数项目的序列实现隐私保护扰动的局限性。
  • 设计一种隐私框架,在保持强隐私保障的同时,显著提升小规模数据收集的统计实用性。
  • 通过私有遥测数据实现对勒索软件检测、操作系统漏洞分析及可疑活动监控等网络安全任务的准确推断。
  • 形式化一个贝叶斯攻击者模型,以确保CLDP在相同威胁模型下提供与标准LDP等效的隐私保护。

提出的方法

  • 提出凝聚局部差分隐私(CLDP)作为LDP的一种特化形式,利用凝聚概率分布偏好相似输出而非远距离输出。
  • 采用指数机制的一种变体作为核心构建模块,以设计CLDP协议,确保同时满足隐私与实用性优化。
  • 设计序数-CLDP用于有限度量空间数据(如数值型恶意软件统计),项目-CLDP用于非序数类别数据(如操作系统版本),序列-CLDP用于混合数据类型的有序序列。
  • 应用指数机制并设计精心构造的评分函数,以在隐私与实用性之间取得平衡,尤其偏好频繁或语义相似的值。
  • 使用贝叶斯攻击者模型,正式证明CLDP在最大后验置信度攻击下提供与标准LDP等效的隐私保障。
  • 在真实Symantec数据集和公开基准数据集上实现并评估协议,其中部分数据集规模比以往LDP研究使用的数据集小一个数量级。

实验结果

研究问题

  • RQ1能否设计一种隐私保护数据收集框架,在小用户群体(如<10,000名用户)的网络安全应用中仍保持高实用性?
  • RQ2如何将局部差分隐私扩展至支持对既保留内容又保留长度的序列实现隐私保护扰动,尤其当序列中包含混合的序数与非序数项目时?
  • RQ3在低用户规模场景下,与标准LDP机制相比,使用凝聚概率分布在多大程度上提升了实用性?
  • RQ4CLDP协议能否在保护用户隐私的前提下,实现对勒索软件爆发检测与漏洞识别等关键网络安全任务的准确推断?
  • RQ5在估计频繁项目与排序序列方面,CLDP协议与现有LDP协议(如SVIM)相比在实用性上表现如何?

主要发现

  • 在相同隐私预算(ε)下,序列-CLDP在平均相对误差(AvRE)指标上相比SVIM协议实现了30%至90%的更高准确性,尤其在k值较小时表现更优。
  • 当k > 512时,SVIM的误差率几乎呈指数级增长,而序列-CLDP仅表现出线性或次线性退化,表明其在稀有项目估计方面具有更优的可扩展性。
  • 当k > 128时,序列-CLDP的Kendall-tau评分显著优于SVIM,表明其在保持序列顺序与排序质量方面表现更佳。
  • 所提出的CLDP协议即使在用户规模比以往LDP研究使用的数据集小一个数量级的数据集上,仍能保持高实用性,使低规模网络安全场景下的准确推断成为可能。
  • 基于Symantec数据集的案例研究证实,CLDP协议能准确支持关键安全任务,包括勒索软件爆发检测、目标系统与易受攻击操作系统的识别,以及可疑机器行为的分析。
  • 贝叶斯攻击者模型验证表明,CLDP提供的隐私保障与标准LDP等效,确保攻击者在推断真实值时的最大后验置信度保持有界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。