Skip to main content
QUICK REVIEW

[论文解读] Universal Adversarial Perturbation for Text Classification

Hang Gao, Tim Oates|arXiv (Cornell University)|Oct 10, 2019
Adversarial Robustness in Machine Learning参考文献 29被引用 11
一句话总结

本文提出一种在文本分类器的嵌入空间中生成通用对抗扰动的方法,其中对每个词元(token)应用同一个、微小的扰动向量(与词元无关),以高概率误导最先进的模型。该方法在多个自然语言处理任务中实现了高欺骗率,同时保持语义邻域结构,揭示了深度神经网络对极小、可迁移扰动的脆弱性。

ABSTRACT

Given a state-of-the-art deep neural network text classifier, we show the existence of a universal and very small perturbation vector (in the embedding space) that causes natural text to be misclassified with high probability. Unlike images on which a single fixed-size adversarial perturbation can be found, text is of variable length, so we define the "universality" as "token-agnostic", where a single perturbation is applied to each token, resulting in different perturbations of flexible sizes at the sequence level. We propose an algorithm to compute universal adversarial perturbations, and show that the state-of-the-art deep neural networks are highly vulnerable to them, even though they keep the neighborhood of tokens mostly preserved. We also show how to use these adversarial perturbations to generate adversarial text samples. The surprising existence of universal "token-agnostic" adversarial perturbations may reveal important properties of a text classifier.

研究动机与目标

  • 探究是否存在一种通用的、微小的嵌入空间扰动,能够误导深度神经网络文本分类器。
  • 开发一种算法,用于计算与输入样本长度无关的文本通用对抗扰动。
  • 生成在语义和句法上合理且能规避分类的对抗性文本样本。
  • 在多种自然语言处理任务中评估最先进文本分类器在这些通用扰动下的鲁棒性。

提出的方法

  • 该方法将通用对抗扰动建模为一个优化问题,旨在最大化所有训练样本的误分类损失,同时受小的 p-范数(p=2)约束。
  • 通过在扰动向量 δ 上使用梯度上升,并对梯度进行归一化,以确保扰动保持在 l_p 范数的 ε 边界内。
  • 该算法使用训练数据的小批量迭代更新 δ,每步后将 δ 投影回 l_p 球内以维持范数约束。
  • 扰动被统一应用于输入序列中的每个词元,使其具有‘与词元无关’的特性——无论上下文如何,每个词元均使用相同的 δ。
  • 通过将每个词元替换为其在扰动嵌入空间中的最近邻来生成对抗性样本,以最大化与扰动向量的余弦相似度。
  • 使用 Adam 优化器进行训练,采用归一化梯度,并在验证数据上使用早停策略,固定 ε 以确保扰动不可察觉。

实验结果

研究问题

  • RQ1是否可以在嵌入空间中设计出一个单一、微小的扰动,使其在多种输入和任务中普遍误导深度神经网络文本分类器?
  • RQ2与词元无关的扰动策略在生成对抗样本的同时,对保持语义邻域结构的有效性如何?
  • RQ3训练通用对抗扰动以实现高欺骗性能所需的最小训练数据量是多少?
  • RQ4与随机或基于词汇表的基线扰动相比,所提方法在欺骗率和语义保持方面表现如何?
  • RQ5该扰动在不同自然语言处理任务和模型架构之间具有多大程度的可迁移性?

主要发现

  • 在 MRPC 任务上,该方法实现了 95.9% 的欺骗率,优于所有基线方法,包括随机和基于词汇表的扰动。
  • 仅使用 10% 的训练数据,该方法在 SST-2 上达到 87.7% 的准确率,表明其具有强大的数据效率和可扩展性。
  • 在 MRPC 上 NI(V) 得分为 0.959,表明该扰动比基于词汇表的基线方法更好地保持了词元的邻域结构。
  • 即使将 ε 设置为 0.2,该方法仍保持高欺骗性能,表明扰动在嵌入范数意义上保持不可察觉。
  • 通过该方法生成的对抗性样本在语言学上合理,并导致一致的误分类,如表 5 所示,仅句法变化即可导致预测结果翻转。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。