Skip to main content
QUICK REVIEW

[论文解读] Membership Model Inversion Attacks for Deep Networks

Samyadeep Basu, Rauf Izmailov|arXiv (Cornell University)|Oct 9, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用 14
一句话总结

本文提出了一种基于生成对抗网络(GAN)的成员身份模型反演攻击方法,通过利用特定领域的知识,在连通的低维潜在流形上优化,生成真实且可识别的类别表征(如手写数字或服装物品)。与以往产生不可解释输出的攻击不同,该方法成功恢复了语义上有意义的样本,表明当攻击者掌握数据领域上下文知识时,深度模型容易遭受隐私泄露。

ABSTRACT

With the increasing adoption of AI, inherent security and privacy vulnerabilities formachine learning systems are being discovered. One such vulnerability makes itpossible for an adversary to obtain private information about the types of instancesused to train the targeted machine learning model. This so-called model inversionattack is based on sequential leveraging of classification scores towards obtaininghigh confidence representations for various classes. However, for deep networks,such procedures usually lead to unrecognizable representations that are uselessfor the adversary. In this paper, we introduce a more realistic definition of modelinversion, where the adversary is aware of the general purpose of the attackedmodel (for instance, whether it is an OCR system or a facial recognition system),and the goal is to find realistic class representations within the corresponding lower-dimensional manifold (of, respectively, general symbols or general faces). To thatend, we leverage properties of generative adversarial networks for constructinga connected lower-dimensional manifold, and demonstrate the efficiency of ourmodel inversion attack that is carried out within that manifold.

研究动机与目标

  • 解决现有深度神经网络模型反演攻击的局限性,即由于搜索空间维度高且病态,导致输出不可识别、无法使用。
  • 探究在目标模型应用领域(如光学字符识别或人脸识别)中引入一般性知识,是否能够引导恢复出语义上有意义的代表性样本。
  • 证明通过在目标领域多样化数据上训练 GAN 构建的连通低维潜在流形,能够实现高效且有效的优化,从而获得高置信度的真实类别表征。
  • 在真实世界数据集(如 MNIST 和 Fashion MNIST)上评估所提方法的有效性,表明其在无领域知识的常规反演攻击之上表现更优。

提出的方法

  • 该方法使用生成对抗网络(GAN)对目标应用领域(如手写字符或人脸)的数据建立连通的低维潜在流形,从而在更具语义意义的空间中进行受限搜索。
  • GAN 的生成器网络将连续潜在空间(如高斯噪声)映射为在结构和语义上与真实训练数据相似的合成数据样本。
  • 在 GAN 的潜在空间中执行优化,以最大化目标分类器对特定类别的置信度分数,使用包含标签置信度和正则化的可微分目标函数。
  • 该攻击假设可获得目标模型的白盒访问权限,并利用潜在流形结构避免在完整高维输入空间中直接优化所导致的病态问题。
  • 通过 ℓp 范数(p=1 到 6)进行正则化,以提升图像质量,但实验表明其对最终结果影响甚微。
  • 该方法在 MNIST 和 Fashion MNIST 数据集上进行了验证,其中 GAN 在完整数据集上进行训练,以生成用于反演搜索的连通潜在流形。

实验结果

研究问题

  • RQ1当攻击者掌握目标模型应用领域的特定知识时,深度神经网络的模型反演攻击是否能够产生可识别且语义上有意义的类别表征?
  • RQ2通过 GAN 构建连通的低维潜在流形,是否能相比在完整输入空间中直接优化,显著提升反演样本的质量与可解释性?
  • RQ3ℓp 正则化在 GAN 基础的反演框架中,对提升反演样本的视觉质量有多大程度的增强作用?
  • RQ4当目标模型仅在部分类别上进行训练时,该 GAN 基础方法在恢复真实世界数据集(如 MNIST 和 Fashion MNIST)代表性样本方面的有效性如何?
  • RQ5即使精确的训练样本未包含在 GAN 的训练数据中,GAN 潜在空间的连通结构是否仍可用于寻找高置信度且真实感强的表征?

主要发现

  • 所提出的基于 GAN 的模型反演攻击在攻击者具备领域知识时,能够成功恢复出真实且可识别的类别表征(如数字和服装物品),而标准攻击则产生不可解释的输出。
  • 在缺乏领域知识的情况下,直接在完整输入空间中进行优化无法产生有意义的样本,如图 1 所示,对类别 '5'、'6' 和 '9' 反演得到的图像完全不可识别。
  • 在具备领域知识并结合 GAN 基于流形搜索时,攻击生成了高置信度且语义一致的样本,如图 2 所示的 MNIST 类别 '0'、'1' 和 '3',以及图 3 所示的 Fashion MNIST 类别 'T-shirts'、'Coats' 和 'Sneakers'。
  • 使用 ℓp 范数(p=1 到 6)进行正则化对图像质量影响可忽略,表明 GAN 的内在结构已足够将优化约束在视觉上合理的结果范围内。
  • 即使 GAN 在更广泛的数据集上进行训练(如所有 MNIST 数字或所有 Fashion MNIST 类别),该攻击仍能有效恢复未明确包含在 GAN 训练数据中的目标类别表征。
  • 结果表明,GAN 可作为模型反演的强大工具,通过提供连通且结构化的搜索空间,与真实数据流形的内在几何结构相一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。