[论文解读] Data Poisoning Attacks to Local Differential Privacy Protocols
本文提出针对本地差分隐私(LDP)协议的数据投毒攻击,攻击者通过注入伪造用户并发送精心设计的扰动数据,以操纵频率估计和热点项目识别的结果。所提出的最大收益攻击(MGA)将攻击建模为优化问题,在仅使用5%伪造用户的情况下,即可显著提高目标项目的频率估计,凸显了LDP设计中安全与隐私之间的关键权衡。
Local Differential Privacy (LDP) protocols enable an untrusted data collector to perform privacy-preserving data analytics. In particular, each user locally perturbs its data to preserve privacy before sending it to the data collector, who aggregates the perturbed data to obtain statistics of interest. In the past several years, researchers from multiple communities -- such as security, database, and theoretical computer science -- have proposed many LDP protocols. These studies mainly focused on improving the utility of the LDP protocols. However, the security of LDP protocols is largely unexplored. In this work, we aim to bridge this gap. We focus on LDP protocols for frequency estimation and heavy hitter identification, which are two basic data analytics tasks. Specifically, we show that an attacker can inject fake users into an LDP protocol and the fake users send carefully crafted data to the data collector such that the LDP protocol estimates high frequencies for arbitrary attacker-chosen items or identifies them as heavy hitters. We call our attacks data poisoning attacks. We theoretically and/or empirically show the effectiveness of our attacks. We also explore three countermeasures against our attacks. Our experimental results show that they can effectively defend against our attacks in some scenarios but have limited effectiveness in others, highlighting the needs for new defenses against our attacks.
研究动机与目标
- 探究本地差分隐私(LDP)协议在隐私保证之外的安全漏洞。
- 识别攻击者是否可通过注入伪造用户来操纵LDP分析结果。
- 开发一种系统性、基于优化的方法,以最大化此类投毒攻击的影响。
- 评估现有防护措施在真实场景中对抗此类攻击的有效性。
- 揭示在对抗性数据投毒攻击下,LDP协议中根本的安全-隐私权衡。
提出的方法
- 将数据投毒建模为优化问题,以最大化目标项目的频率增益,从而提出最大收益攻击(MGA)。
- 通过理论分析推导MGA下目标项目的频率增益,证明其在所有攻击策略中可实现最高可能的增益。
- 采用两种基线攻击方法,即使用伪造用户生成的随机扰动数据,与MGA的性能进行对比。
- 将MGA及基线方法应用于四种最先进的LDP协议:kRR、OUE、OLH用于频率估计,以及PEM用于热点项目识别。
- 评估包括统计模式检测、工作量证明(Proof-of-Work)和基于SMPC的缓解机制在内的防御措施,分析其可行性与局限性。
- 提出一种基于条件概率的检测方法,通过分析扰动向量模式识别伪造用户。
实验结果
研究问题
- RQ1攻击者是否可通过注入携带精心设计数据的伪造用户,操纵基于LDP的频率估计与热点项目识别结果?
- RQ2与随机基线攻击相比,基于优化的最高收益攻击(MGA)在有效性方面表现如何?
- RQ3LDP协议中隐私保证与抗数据投毒攻击安全性之间的根本关系是什么?
- RQ4现有防护措施(如归一化、工作量证明和统计检测)在防御MGA攻击方面的有效性如何?
- RQ5该攻击是否可推广至基于SMPC或混淆机制的LDP协议?其局限性是什么?
主要发现
- 理论上证明,最大收益攻击(MGA)在所有可能的攻击策略中,对目标项目的频率增益达到最高。
- 仅使用5%的伪造用户,MGA即可在所有测试的三个数据集中,成功将10个随机选择的目标项目提升为前15名热点项目。
- 存在根本性的安全-隐私权衡:隐私保证更强的协议(如更高的ε值)对数据投毒攻击更具脆弱性。
- OUE与OLH在对抗MGA时表现出相似的安全水平,而当项目数量超过某一阈值时,kRR的安全性低于OUE与OLH。
- 现有防护措施如归一化和统计检测效果有限,尤其在攻击者可适应防御机制时,表明亟需更强大、新型的防御机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。