Skip to main content
QUICK REVIEW

[论文解读] Adversarial Attack and Defense of Structured Prediction Models

Wenjuan Han, Liwen Zhang|arXiv (Cornell University)|Oct 4, 2020
Adversarial Robustness in Machine Learning参考文献 34被引用 4
一句话总结

本文提出了一种新颖的、黑盒的、在线对抗攻击框架,用于自然语言处理中的结构化预测模型,采用通过强化学习训练的序列到序列生成器,并结合多个参考模型的反馈。该方法生成流畅且高度对抗性的句子,能有效欺骗最先进的依存句法分析器和词性标注器,并通过对抗训练进一步提升模型鲁棒性,攻击成功率最高达80.1%的句级成功率,同时显著提升流畅度。

ABSTRACT

Building an effective adversarial attacker and elaborating on countermeasures for adversarial attacks for natural language processing (NLP) have attracted a lot of research in recent years. However, most of the existing approaches focus on classification problems. In this paper, we investigate attacks and defenses for structured prediction tasks in NLP. Besides the difficulty of perturbing discrete words and the sentence fluency problem faced by attackers in any NLP tasks, there is a specific challenge to attackers of structured prediction models: the structured output of structured prediction models is sensitive to small perturbations in the input. To address these problems, we propose a novel and unified framework that learns to attack a structured prediction model using a sequence-to-sequence model with feedbacks from multiple reference models of the same structured prediction task. Based on the proposed attack, we further reinforce the victim model with adversarial training, making its prediction more robust and accurate. We evaluate the proposed framework in dependency parsing and part-of-speech tagging. Automatic and human evaluations show that our proposed framework succeeds in both attacking state-of-the-art structured prediction models and boosting them with adversarial training.

研究动机与目标

  • 为解决自然语言处理中结构化预测模型的攻击挑战,这些模型对输入扰动高度敏感,且与分类任务存在根本性差异。
  • 克服基于梯度的方法和词级攻击方法的局限性,后者因离散标记约束和句子流畅性问题而失效。
  • 设计一种无需模型梯度或迭代优化的黑盒、在线攻击者,实现高效且可泛化的攻击。
  • 通过使用生成的对抗样本进行对抗训练,开发一种防御机制,以提升模型鲁棒性。

提出的方法

  • 使用自定义奖励函数,通过强化学习训练一个序列到序列(seq2seq)句子生成器,该奖励函数评估受害模型输出与同一结构化预测任务下多个参考模型输出的一致性。
  • 奖励函数结合三个组成部分:受害模型输出的可能性、受害模型与参考模型输出之间的相似性,以及来自预训练语言模型的句子流畅度得分。
  • 攻击在黑盒设置下运行,无需访问受害模型的架构、参数或梯度,从而具备广泛适用性。
  • 攻击为在线式:一旦训练完成,生成器可直接从输入句子生成对抗样本,无需进一步优化或访问模型。
  • 通过在生成的对抗样本上微调受害模型,应用对抗训练,以提升其鲁棒性和准确性。
  • 该框架通过自动评估与人工评估,在依存句法分析和词性标注任务上进行了评估。

实验结果

研究问题

  • RQ1基于seq2seq的生成器结合多参考模型反馈,能否有效生成对抗样本以攻击自然语言处理中的结构化预测模型?
  • RQ2参考模型的选择(相同 vs. 不同)如何影响生成样本的流畅度与对抗有效性?
  • RQ3所提出的攻击框架能否在不同结构化预测模型与架构上有效应用?
  • RQ4使用生成样本进行对抗训练在多大程度上提升了受害模型的鲁棒性与准确性?
  • RQ5与现有基于梯度或词级的攻击方法相比,该方法在攻击成功率与句子流畅度方面表现如何?

主要发现

  • 所提出的攻击框架在使用Deep Biaffine和BiST解析器作为参考模型时,对依存句法分析任务实现了80.1%的句级攻击成功率,显著优于基线方法。
  • 人工评估显示,生成的对抗句子流畅度得分为3.84(5分制),优于AllSame(4.19)和EvalSame(3.54)设置,表明在流畅度与攻击效果之间实现了更优平衡。
  • 该攻击框架成功生成了对抗样本,导致最先进的结构化预测模型产生错误的句法树或词性标注,即使扰动微小且句子流畅。
  • 使用生成样本进行对抗训练显著提升了受害模型的鲁棒性与准确性,证明了防御机制的有效性。
  • 该框架具备良好的泛化能力:在不同受害模型(如StackPtr)和参考解析器组合中均表现出一致性能,证实了其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。