Skip to main content
QUICK REVIEW

[论文解读] Robust or Private? Adversarial Training Makes Models More Vulnerable to Privacy Attacks

Felipe A. Mejia, Paul Gamble|arXiv (Cornell University)|Jun 15, 2019
Adversarial Robustness in Machine Learning参考文献 16被引用 9
一句话总结

本文表明,旨在提升模型对对抗攻击鲁棒性的对抗训练,会显著增加模型对模型反演攻击的脆弱性,使得此前不可行的训练数据重建成为可能。关键发现是,鲁棒模型表现出更具语义意义的激活,使其更易于反演,而传统训练模型则因对抗样本的存在而使反演过程受阻。

ABSTRACT

Adversarial training was introduced as a way to improve the robustness of deep learning models to adversarial attacks. This training method improves robustness against adversarial attacks, but increases the models vulnerability to privacy attacks. In this work we demonstrate how model inversion attacks, extracting training data directly from the model, previously thought to be intractable become feasible when attacking a robustly trained model. The input space for a traditionally trained model is dominated by adversarial examples - data points that strongly activate a certain class but lack semantic meaning - this makes it difficult to successfully conduct model inversion attacks. We demonstrate this effect using the CIFAR-10 dataset under three different model inversion attacks, a vanilla gradient descent method, gradient based method at different scales, and a generative adversarial network base attacks.

研究动机与目标

  • 探究深度学习模型中对抗鲁棒性与数据隐私之间的权衡。
  • 评估对抗训练模型(ATMs)是否比传统训练模型(TTMs)更容易遭受模型反演攻击。
  • 分析传统训练模型中对抗样本的存在如何阻碍模型反演,而对抗训练模型则允许更精确的重建。
  • 利用特征相似度和L2距离度量量化模型反演攻击的成功程度。
  • 识别在鲁棒模型中反演过程中泄露的视觉特征(例如,颜色、形状、背景)。

提出的方法

  • 在CIFAR-10数据集上训练了三个图像分类模型:两个传统训练模型(TTM-VGG16 和 TTM-Res)和一个使用标准最小最大公式与L2扰动的对抗训练模型(ATM-Res)。
  • 应用了三种模型反演攻击:原始梯度下降、多尺度梯度优化,以及基于GAN的攻击。
  • 通过计算反演图像与最后一个卷积层中训练集特征之间的余弦相似度,并计算与最近似配图像的L2距离,来衡量反演的成功程度。
  • 改变对抗半径(扰动幅度)以评估其对对抗鲁棒性和隐私泄露的影响。
  • 通过检查哪些特征(例如,物体形状、背景、标志)在反演中被保留或模糊化,对重建结果进行定性分析。
  • 通过比较TTM与ATM的激活模式,解释反演可行性差异的原因。

实验结果

研究问题

  • RQ1与传统训练相比,对抗训练是否显著增加了对模型反演攻击的脆弱性?
  • RQ2为何模型反演攻击在传统训练模型上无效,而在对抗训练模型上却可行?
  • RQ3传统训练模型中的对抗样本如何干扰反演过程?
  • RQ4从对抗训练模型中重建的图像在多大程度上保留了物体形状和颜色等语义特征?
  • RQ5特征级相似度和L2距离度量能否有效量化模型反演攻击的成功程度?

主要发现

  • 对抗训练模型(ATM-Res)比传统训练模型(TTM-VGG16 和 TTM-Res)显著更易遭受模型反演攻击,成功重建了物体形状和颜色等语义特征。
  • 由于输入空间中主导着语义上无意义的对抗样本,传统训练模型上的模型反演攻击无法产生有意义的重建结果。
  • ATM-Res模型在验证集上达到84.9%的准确率和95.7%的训练准确率,但仍会在重建中泄露可识别的特征,如船的形状和汽车轮廓。
  • 当以训练图像为种子时,ATM能生成稳定且语义连贯的重建结果,突出关键特征;而TTM则将输入转化为对抗样本。
  • ATM的反演图像与最近似训练图像之间的L2距离显著低于TTM,表明反演成功率更高。
  • 背景特征通常被较好地保护,但一致的前景特征(如水面的船、道路的汽车)被可靠地重建,表明结构化模式存在隐私泄露。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。