Skip to main content
QUICK REVIEW

[论文解读] Learning to Attack: Towards Textual Adversarial Attacking in Real-world Situations

Yuan Zang, Bairu Hou|arXiv (Cornell University)|Sep 19, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用 9
一句话总结

本文提出了一种基于强化学习的文本对抗攻击模型,该模型通过学习攻击历史来提升在现实场景中的效率与有效性。通过学习最优的词语替换策略,该模型在显著减少查询次数的同时实现了更高的攻击成功率,相较于现有方法在多种自然语言处理任务的基于分数和基于决策的设置中均表现更优。

ABSTRACT

Adversarial attacking aims to fool deep neural networks with adversarial examples. In the field of natural language processing, various textual adversarial attack models have been proposed, varying in the accessibility to the victim model. Among them, the attack models that only require the output of the victim model are more fit for real-world situations of adversarial attacking. However, to achieve high attack performance, these models usually need to query the victim model too many times, which is neither efficient nor viable in practice. To tackle this problem, we propose a reinforcement learning based attack model, which can learn from attack history and launch attacks more efficiently. In experiments, we evaluate our model by attacking several state-of-the-art models on the benchmark datasets of multiple tasks including sentiment analysis, text classification and natural language inference. Experimental results demonstrate that our model consistently achieves both better attack performance and higher efficiency than recently proposed baseline methods. We also find our attack model can bring more robustness improvement to the victim model by adversarial training. All the code and data of this paper will be made public.

研究动机与目标

  • 解决现有基于分数和基于决策的文本对抗攻击模型在现实场景中因查询次数过多而导致的低效问题。
  • 开发一种具备学习能力的攻击模型,通过利用攻击历史提升攻击效率。
  • 在多样化的自然语言处理任务中,评估该模型在基于分数和基于决策的攻击设置下的性能表现。
  • 探究使用本模型生成的对抗样本进行对抗训练是否能增强受害模型的鲁棒性。
  • 证明本模型在攻击成功率和查询效率方面相较于最先进基线方法的优越性。

提出的方法

  • 该模型使用深度强化学习来学习选择输入句子中影响受害模型预测的关键词语的策略。
  • 采用序列到序列的动作空间,通过词嵌入、同义词或语义表示,迭代地将关键词语替换为语义相似的替代词。
  • 通过策略梯度方法训练智能体,以最大化累积奖励,该奖励定义为以最少查询次数成功欺骗受害模型。
  • 该模型在基于分数和基于决策的设置下运行,仅需模型输出(分数或预测结果),而无需梯度信息或完整模型访问权限。
  • 通过将攻击历史存储并融入其策略参数中,实现基于经验的学习,从而提升未来攻击的效率。
  • 该方法在三个自然语言处理任务——情感分析、文本分类和自然语言蕴涵——上进行了评估,使用了最先进的模型(ALBERT、XLNet、RoBERTa)以及两个公开API。

实验结果

研究问题

  • RQ1基于强化学习的攻击模型是否能在查询次数更少的情况下,实现比现有基于分数和基于决策的方法更高的攻击成功率?
  • RQ2能否从攻击历史中学习是否能显著提升现实对抗场景下的攻击效率?
  • RQ3由本模型生成的对抗样本是否能通过对抗训练带来比使用PSO+Sememe生成样本更大的受害模型鲁棒性提升?
  • RQ4该模型在多样化的自然语言处理任务和受害模型(包括黑盒API)上的表现如何?
  • RQ5与基线攻击方法相比,本模型是否对对抗训练更具鲁棒性?

主要发现

  • 在所有数据集和受害模型中,该模型在基于分数和基于决策的设置下均实现了最高的攻击成功率,持续优于基线模型。
  • 在基于分数的设置下,该模型在SST-2上的平均查询次数仅为83.96,远低于GA+Embedding的365.69和PWWS+Synonym的101.15。
  • 在基于决策的设置下,该模型在ALBERT上的平均查询次数仅为69.79,显著低于GA’+Embedding的299.14和PSO’+Sememe的158.72。
  • 人工评估确认,该模型的攻击有效性与基线模型相当,表明生成的对抗样本保持自然且语义连贯。
  • 使用本模型生成的样本进行对抗训练,相比使用PSO+Sememe样本进行训练,能带来更大的模型鲁棒性提升,以抵御后续攻击。
  • 该模型更难通过对抗训练进行防御,因为使用其生成样本的攻击在防御下成功率下降更缓慢。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。