Skip to main content
QUICK REVIEW

[论文解读] Does Label Differential Privacy Prevent Label Inference Attacks?

Ruihan Wu, Jin Zhou|arXiv (Cornell University)|Feb 25, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文通过将成功标准重新定义为相对于贝叶斯分类器的优势而非绝对准确率,解决了标签差分隐私(label-DP)模型仍可能遭受标签推理攻击(LIAs)的悖论。它证明了参数ε下的标签-DP将此优势限制在 $1 - \frac{2}{1 + e^{\varepsilon}}$,表明即使训练准确率很高,当ε较小时也不会导致标签泄露,且在包括Criteo 1TB点击日志在内的合成数据和真实世界数据集上验证了该边界。

ABSTRACT

Label differential privacy (label-DP) is a popular framework for training private ML models on datasets with public features and sensitive private labels. Despite its rigorous privacy guarantee, it has been observed that in practice label-DP does not preclude label inference attacks (LIAs): Models trained with label-DP can be evaluated on the public training features to recover, with high accuracy, the very private labels that it was designed to protect. In this work, we argue that this phenomenon is not paradoxical and that label-DP is designed to limit the advantage of an LIA adversary compared to predicting training labels using the Bayes classifier. At label-DP $ε=0$ this advantage is zero, hence the optimal attack is to predict according to the Bayes classifier and is independent of the training labels. Our bound shows the semantic protection conferred by label-DP and gives guidelines on how to choose $\varepsilon$ to limit the threat of LIAs below a certain level. Finally, we empirically demonstrate that our result closely captures the behavior of simulated attacks on both synthetic and real world datasets.

研究动机与目标

  • 解决标签-DP模型尽管具有强隐私保证,仍可能通过标签推理攻击被攻破的表面悖论。
  • 通过测量对手相对于贝叶斯分类器的优势而非绝对预测准确率,重新框架标签推理攻击(LIAs)的评估方式。
  • 推导出在标签-DP下任何LIA对手优势的紧致上界,并将其与隐私参数ε直接关联。
  • 在合成数据集和真实世界数据集(包括高度偏斜的Criteo 1TB点击日志数据集)上,对理论边界进行实证验证。
  • 为在实际应用中将LIA风险控制在预定阈值以下,提供选择ε值的实用指导。

提出的方法

  • 不以绝对准确率为标准,而以相对于贝叶斯分类器的优势来定义标签推理攻击(LIA)的成功,该标准与训练标签无关。
  • 正式证明ε-标签-DP学习器将LIA对手的优势限制在 $1 - \frac{2}{1 + e^{\varepsilon}}$,且随着ε减小而降低。
  • 使用加权攻击效用函数以考虑类别不平衡和标签值差异,确保评估的公平性。
  • 利用模型训练准确率和真实数据集上的测试性能,估计期望攻击效用(EAU)和下界期望攻击效用(L-EAU)。
  • 在合成数据(贝叶斯分类器已知)和真实世界数据(Criteo 1TB点击日志)上,对不同ε值验证理论边界。
  • 应用标签-DP核算,并评估理论边界上界与经验优势之间的差距,以评估紧致性及潜在改进攻击的空间。

实验结果

研究问题

  • RQ1为何标签推理攻击(LIAs)在标签-DP模型上仍能取得高准确率,尽管具有强隐私保证?
  • RQ2标签-DP对LIAs是否真的无效,还是评估指标具有误导性?
  • RQ3在标签-DP下,LIA对手相对于贝叶斯分类器的优势是否可被界定?若可,其与ε的关系如何?
  • RQ4标签-DP模型中高训练准确率是否必然意味着私人标签泄露?
  • RQ5LIA优势的理论边界有多紧致?其在真实世界、噪声大且类别不平衡的数据集上的表现如何?

主要发现

  • 在ε-标签-DP下,LIA优势的理论边界为 $1 - \frac{2}{1 + e^{\varepsilon}}$,随着ε减小而降低,确保了语义隐私。
  • 在合成数据集上,理论边界在小ε和大ε值下均紧密覆盖简单预测攻击(SPA)的经验优势。
  • 在Criteo 1TB点击日志数据集上,SPA攻击的标签推理准确率约为97%,但当ε ≤ 2时优势为负,表明其表现劣于贝叶斯分类器。
  • 尽管训练准确率很高,但小ε的标签-DP并不会泄露超出贝叶斯分类器所隐含的私人标签信息,从而解决了表面悖论。
  • 理论边界上界与观测到的优势之间的经验差距表明,存在改进标签-DP核算或更有效LIAs的空间。
  • 研究表明,当使用正确指标——即对手相对于贝叶斯分类器的优势——评估时,标签-DP不会被LIAs破坏,从而提供了一个原则化的隐私-效用校准框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。