Skip to main content
QUICK REVIEW

[论文解读] A General Framework for Auditing Differentially Private Machine Learning

Fred Lu, Joseph Muñoz|arXiv (Cornell University)|Oct 16, 2022
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本文提出了 ML-Audit,一种用于经验性审计机器学习模型差分隐私(DP)保证的通用框架。通过结合基于影响的数据 poisoning 攻击与一种改进的统计估计方法,该框架在跨多种模型的隐私损失估计方面实现了比以往方法高得多的审计能力,能够检测出逻辑回归、朴素贝叶斯和随机森林等模型实现中的实现缺陷和实际存在的隐私泄露。

ABSTRACT

We present a framework to statistically audit the privacy guarantee conferred by a differentially private machine learner in practice. While previous works have taken steps toward evaluating privacy loss through poisoning attacks or membership inference, they have been tailored to specific models or have demonstrated low statistical power. Our work develops a general methodology to empirically evaluate the privacy of differentially private machine learning implementations, combining improved privacy search and verification methods with a toolkit of influence-based poisoning attacks. We demonstrate significantly improved auditing power over previous approaches on a variety of models including logistic regression, Naive Bayes, and random forest. Our method can be used to detect privacy violations due to implementation errors or misuse. When violations are not present, it can aid in understanding the amount of information that can be leaked from a given dataset, algorithm, and privacy specification.

研究动机与目标

  • 为解决当前缺乏实用工具来评估差分隐私机器学习模型中真实世界隐私泄露的问题。
  • 开发一种适用于多种机器学习模型的通用审计框架,超越特定架构(如神经网络)的限制。
  • 通过克服以往方法的局限性(如高再训练成本和弱攻击策略),提升隐私审计的统计功效。
  • 检测由于实现错误或配置不当导致的实际隐私违规。
  • 为实践者提供一种可靠的方法来估计真实隐私风险,从而指导更优的差分隐私参数 ε 和 δ 的选择。

提出的方法

  • 设计基于影响的数据 poisoning 攻击,以生成对抗性的相邻数据集 D 和 D′,使给定模型的隐私损失最大化。
  • 扩展 Bichsel 等人和 Jagielski 等人的统计框架,通过在一般模型摘要 τ 上建模似然函数,实现更小样本量下的 ε 估计。
  • 通过针对最易受扰动影响的摘要统计量 τ(如类别先验、均值、方差)来优化攻击策略。
  • 使用蒙特卡洛采样模型输出来估计隐私损失,并结合改进的边界估计与方差减少技术。
  • 将该框架应用于实际实现的审计,包括 diffprivlib 的朴素贝叶斯和 DP 随机森林,以检测配置错误和暴露缺陷。
  • 将攻击与估计组件整合为统一的流水线,支持任意机器学习模型和差分隐私机制。

实验结果

研究问题

  • RQ1通用框架能否有效审计除深度神经网络等特定案例外的多种机器学习模型的差分隐私?
  • RQ2数据 poisoning 攻击策略的选择如何影响隐私审计的统计功效?
  • RQ3DP ML 库中的实现错误(如暴露内部统计量)在多大程度上会破坏理论隐私保证?
  • RQ4数据集分布如何影响实际可实现的隐私泄露程度,且该影响能否被量化?
  • RQ5该框架能否检测到理论 DP 定义(如单行添加 vs. 修改)与实际实现之间的差异?

主要发现

  • ML-Audit 框架相比以往方法实现了数量级更高的审计能力,显著提升了隐私违规的检测能力。
  • 基于影响的攻击在非球形数据集上优于标准扰动方法(如 ClipBKD),因其与模型敏感度具有更好的对齐性。
  • 该框架检测到 diffprivlib 的朴素贝叶斯实现中存在关键隐私泄露:暴露的类别计数使得训练数据可被完全重建,从而破坏了所有隐私保证。
  • 对于 DP 随机森林,框架发现其实际实现使用的相邻定义比预期更严格,导致隐私损失达到理论边界的两倍。
  • 在 FMNIST 和 CIFAR10 上,影子对抗攻击在某些情况下优于 ClipBKD,而结合额外 τ 信息的修改版 ClipBKD 也表现出适度改进。
  • 该框架表明,实际隐私泄露通常低于理论边界,但实现缺陷仍可能导致即使在数学上正确的算法中出现违规。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。