Skip to main content
QUICK REVIEW

[论文解读] Semantics Preserving Adversarial Learning

Ousmane Dia, Elnaz Barshan|arXiv (Cornell University)|Mar 10, 2019
Adversarial Robustness in Machine Learning参考文献 39被引用 6
一句话总结

该论文提出了一种语义保持的对抗性攻击框架,通过变分推断学习输入的低维几何流形,利用基于Gram-Schmidt的不变性在流形内进行扰动,并应用端到端的对抗性优化生成对抗性样本。该方法在保持图像和文本语义一致性的前提下,对经过认证和未经认证的防御机制均实现了高成功率。

ABSTRACT

While progress has been made in crafting visually imperceptible adversarial examples, constructing semantically meaningful ones remains a challenge. In this paper, we propose a framework to generate semantics preserving adversarial examples. First, we present a manifold learning method to capture the semantics of the inputs. The motivating principle is to learn the low-dimensional geometric summaries of the inputs via statistical inference. Then, we perturb the elements of the learned manifold using the Gram-Schmidt process to induce the perturbed elements to remain in the manifold. To produce adversarial examples, we propose an efficient algorithm whereby we leverage the semantics of the inputs as a source of knowledge upon which we impose adversarial constraints. We apply our approach on toy data, images and text, and show its effectiveness in producing semantics preserving adversarial examples which evade existing defenses against adversarial attacks.

研究动机与目标

  • 解决现有攻击方法中原始输入与对抗性样本之间语义不一致的问题。
  • 开发一种在生成对抗性样本过程中保持输入语义的方法,确保扰动保持语义上的合理性。
  • 通过生成能够绕过强防御机制但与原始输入在感知和语义上高度相似的对抗性样本,提升鲁棒性评估的可靠性。
  • 利用几何流形约束,在潜在空间中实现高效、端到端的对抗性攻击生成。

提出的方法

  • 使用带有松弛高斯先验的变分推断,学习输入数据的低维几何摘要(流形),在不施加强分布假设的前提下捕捉语义信息。
  • 采用基于Gram-Schmidt的扰动策略,确保对抗性扰动保持在学习到的流形内部,从而保留几何与语义结构。
  • 在潜在嵌入空间($\mathcal{Z}$)中操作,而非输入空间($\mathcal{X}$),降低计算成本并提升语义保真度。
  • 通过白盒、端到端优化框架,对扰动后的流形元素施加对抗性约束,最大化分类损失的同时保持流形成员身份。
  • 采用类似条件VAE的架构,使用解码器 $p_\phi$ 从潜在码重建输入,实现基于重建的正则化。
  • 利用流形的内在几何结构,定义一个无限制、拓扑感知的搜索空间用于对抗性样本,避免使用均匀的 $\ell_p$-球约束。

实验结果

研究问题

  • RQ1能否生成在保持原始输入语义内容的同时可绕过强防御机制的对抗性样本?
  • RQ2如何建模输入数据的几何结构,以确保对抗性扰动保持语义连贯性?
  • RQ3与输入空间攻击相比,在潜在流形空间中操作是否能提升对认证防御机制的攻击成功率?
  • RQ4所提方法在视觉与自然语言处理任务中,能在多大程度上生成语义合理的对抗性样本?

主要发现

  • 该方法在MNIST数据集上对40步PGD ResNet实现了100%的成功率,优于PGD、Song et al. [2018] 和 Zhao et al. [2018b],在人工评估中表现更优。
  • 在MNIST上,该方法在人类评估中实现了100%的语义合理性评分(Q1: 是)和100%的与原始输入的相似度评分(Q2: 是),显著优于PGD(Q2为66.8%)。
  • 在认证防御机制(Raghunathan et al. [2018] 和 Kolter & Wong [2017])下,该方法实现了100%的成功率,分别超过Song et al. [2018] 的86.6%和88.6%。
  • 在CelebA数据集上,100%的人工评估者认为对抗性样本语义合理(Q1: 是),其中97%认为与原始图像相似。
  • 在SNLI文本分类任务中,该方法实现了83.7%的语义合理性与79.6%的相似度,优于Zhao et al. [2018b] 的60.4%与56.3%。
  • 该方法成功生成了能够绕过认证与非认证防御机制的对抗性样本,同时保持了高语义保真度,展示了在多种模态下的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。