Skip to main content
QUICK REVIEW

[论文解读] Adversarial Training with Fast Gradient Projection Method against Synonym Substitution based Text Attacks

Xiaosen Wang, Yichen Yang|arXiv (Cornell University)|Aug 9, 2020
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出快速梯度投影法(FGPM),一种高效基于梯度的文本对抗攻击方法,通过同义词替换生成对抗样本,速度比现有方法快达20倍,同时保持强大的攻击性能。此外,本文还提出ATFL,一种基于logit配对的新型对抗训练防御方法,显著提升模型鲁棒性,阻断对抗样本的迁移性,并在干净数据上的泛化性能优于以往防御方法。

ABSTRACT

Adversarial training is the most empirically successful approach in improving the robustness of deep neural networks for image classification.For text classification, however, existing synonym substitution based adversarial attacks are effective but not efficient to be incorporated into practical text adversarial training. Gradient-based attacks, which are very efficient for images, are hard to be implemented for synonym substitution based text attacks due to the lexical, grammatical and semantic constraints and the discrete text input space. Thereby, we propose a fast text adversarial attack method called Fast Gradient Projection Method (FGPM) based on synonym substitution, which is about 20 times faster than existing text attack methods and could achieve similar attack performance. We then incorporate FGPM with adversarial training and propose a text defense method called Adversarial Training with FGPM enhanced by Logit pairing (ATFL). Experiments show that ATFL could significantly improve the model robustness and block the transferability of adversarial examples.

研究动机与目标

  • 为解决现有基于同义词替换的文本对抗攻击效率低下问题,该问题阻碍其在实际对抗训练中的应用。
  • 开发一种基于梯度的攻击方法,能高效地在离散且受限的文本空间中搜索,同时保持语义和语法一致性。
  • 通过克服攻击生成过程中的计算瓶颈,实现文本分类任务中有效的对抗训练。
  • 提出一种防御方法,可阻断对抗样本的迁移性,并提升在干净数据上的泛化性能。
  • 探究图像领域中成功的对抗训练正则化方法(如TRADES、MMA)是否可推广至文本领域。

提出的方法

  • 提出FGPM,一种基于梯度的攻击方法,通过嵌入空间中梯度幅值与投影距离的乘积来近似同义词替换的影响。
  • 在每一步中,FGPM选择能最大化置信度变化的同义词替换,由梯度方向引导,实现在每个词上仅需一次前向传播即可完成梯度计算。
  • 提出ATFL,一种将FGPM生成的对抗样本与logit配对正则化相结合的防御方法,以提升鲁棒性和泛化能力。
  • ATFL中的logit配对鼓励模型在原始样本和对抗样本上的预测保持一致,从而在训练过程中增强鲁棒性。
  • 每个词仅需一次反向传播即可计算梯度,与基于查询的方法相比,显著降低了计算时间。
  • 在标准文本基准数据集(AG’s News、IMDB、DBPedia)上,于白盒和黑盒攻击设置下评估了该方法。

实验结果

研究问题

  • RQ1能否将基于梯度的方法高效地适配到离散且受限的文本空间中,以生成基于同义词替换的对抗样本?
  • RQ2与现有基于同义词替换的攻击方法相比,FGPM在速度和攻击成功率方面的表现如何?
  • RQ3FGPM能否有效集成到对抗训练中,以提升模型对白盒和黑盒攻击的鲁棒性?
  • RQ4ATFL是否能有效阻断对抗样本在不同模型和数据集之间的迁移性?
  • RQ5在图像领域中表现成功的正则化技术(如TRADES、MMA)是否能有效推广到文本分类任务中?

主要发现

  • FGPM在攻击成功率上与当前最先进同义词替换攻击方法相当,但速度比目前最快的方法快约20倍。
  • ATFL在AG’s News、IMDB和DBPedia数据集上显著提升了模型对白盒和黑盒攻击的鲁棒性。
  • ATFL有效阻断了对抗样本的迁移性,优于大多数防御基线方法,并在Bi-LSTM模型上达到与SEM相当的最佳性能。
  • ATFL在干净(良性)数据上的泛化性能优于其他防御方法,包括SEM和标准对抗训练。
  • 近期在图像领域中提出的对抗训练变体(如TRADES和MMA)在文本领域中性能下降,表明图像与文本对抗训练存在根本性差异。
  • 所提出的FGPM实现了在离散文本空间中高效基于梯度的对抗训练,为将成功的图像级对抗方法迁移至自然语言处理领域铺平了道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。