Skip to main content
QUICK REVIEW

[论文解读] LatentPoison - Adversarial Attacks On The Latent Space

Antonia Creswell, Anil A. Bharath|arXiv (Cornell University)|Nov 8, 2017
Adversarial Robustness in Machine Learning参考文献 11被引用 9
一句话总结

本文提出LatentPoison,一种新颖的对抗性攻击方法,通过操纵深度变分自编码器(dVAE)的潜在空间,在极小扰动下实现分类标签的翻转。通过在潜在码上施加微小、有针对性的加法或乘法扰动(无需访问模型参数),该方法成功实现预测翻转,同时保持解码图像的质量和高置信度分数,展示了隐蔽的、基于潜在空间的分类系统规避能力。

ABSTRACT

Robustness and security of machine learning (ML) systems are intertwined, wherein a non-robust ML system (classifiers, regressors, etc.) can be subject to attacks using a wide variety of exploits. With the advent of scalable deep learning methodologies, a lot of emphasis has been put on the robustness of supervised, unsupervised and reinforcement learning algorithms. Here, we study the robustness of the latent space of a deep variational autoencoder (dVAE), an unsupervised generative framework, to show that it is indeed possible to perturb the latent space, flip the class predictions and keep the classification probability approximately equal before and after an attack. This means that an agent that looks at the outputs of a decoder would remain oblivious to an attack.

研究动机与目标

  • 探究深度变分自编码器(dVAE)的潜在空间是否可被操纵以在不被检测的情况下改变分类结果。
  • 开发一种仅基于潜在编码操作的实用对抗性攻击,仅需访问编码器输出和分类器预测结果,无需模型参数。
  • 评估在不同正则化方案(L1 和 L2)及扰动类型(加法、乘法)下,潜在空间攻击的隐蔽性与有效性。
  • 证明潜在空间中的极小扰动可导致解码输出出现显著语义变化,同时保持高分类置信度。

提出的方法

  • 该攻击通过仅使用编码器输出和分类器预测结果,学习一个变换 𝒯∘z,将某一类别的潜在码 z 映射为解码后属于另一类别的潜在码。
  • 该方法对潜在码施加加法扰动 Δz,通过损失函数进行优化,以最大化分类器对目标类别的置信度,同时最小化 Δz 的 L1 或 L2 范数。
  • 采用 L1 正则化以促进 Δz 的稀疏性,确保仅少数潜在单元被修改,从而增强隐蔽性。
  • 在面部图像数据集(微笑 vs. 无微笑)上采用二分类设置进行评估,解码器从扰动后的潜在码重建图像。
  • 该攻击独立应用于每个潜在码,且所有样本均使用相同的变换 𝒯,使其具备可扩展性和泛化能力。
  • 攻击的成功主要归因于 dVAE 潜在空间的近似线性结构,使得类间可实现平滑插值。

实验结果

研究问题

  • RQ1dVAE 潜在空间中的对抗性扰动是否能成功翻转解码图像的预测类别,同时不改变其感知质量?
  • RQ2当仅能访问编码器输出和分类器预测结果而无法获取模型参数时,该攻击的有效性如何?
  • RQ3L1 正则化在多大程度上减少了被修改的潜在单元数量?这是否增强了攻击的隐蔽性?
  • RQ4不同类型的扰动(加法 vs. 乘法)及正则化方案如何影响攻击的成功率与可检测性?
  • RQ5该攻击是否能在保持原始类别置信度不变的同时,使分类器对翻转后类别的置信度保持较高?

主要发现

  • 该攻击成功将预测类别从“无微笑”翻转为“微笑”,反之亦然,且重建图像与原始重建结果在视觉上无法区分。
  • 在 L1 正则化下,Δz 实现了高稀疏性,仅修改极少数潜在单元,同时仍能成功翻转预测结果。
  • 在“无微笑 → 微笑”攻击中,Poisoning+Class 攻击类型下分类器置信度提升至 0.98,表明扰动被有效优化。
  • 在相同条件下,“微笑 → 无微笑”攻击的置信度达到 0.96,表明在两个方向上均表现出一致的性能。
  • 该攻击保持隐蔽性,因为篡改输出的置信度高于原始数据和重建样本,使得检测变得困难。
  • 攻击的成功主要归因于 dVAE 潜在空间的近似线性结构,使得通过加法扰动可实现类间平滑过渡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。