Skip to main content
QUICK REVIEW

[论文解读] A Survey of Adversarial Defences and Robustness in NLP

Shreya Goyal, Sumanth Doddapaneni|arXiv (Cornell University)|Mar 12, 2022
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本综述全面回顾了自然语言处理(NLP)中的对抗性防御方法,提出了一种新颖的分类法,用于对针对词级、字符级和句子级扰动的防御技术进行分类。该综述评估了诸如同义词编码、方向约束对抗训练以及通过差分隐私实现的认证鲁棒性等防御方法,突出显示了其在提升模型抗干扰能力的同时,仍能保持在标准NLP任务上的性能表现。

ABSTRACT

In the past few years, it has become increasingly evident that deep neural networks are not resilient enough to withstand adversarial perturbations in input data, leaving them vulnerable to attack. Various authors have proposed strong adversarial attacks for computer vision and Natural Language Processing (NLP) tasks. As a response, many defense mechanisms have also been proposed to prevent these networks from failing. The significance of defending neural networks against adversarial attacks lies in ensuring that the model's predictions remain unchanged even if the input data is perturbed. Several methods for adversarial defense in NLP have been proposed, catering to different NLP tasks such as text classification, named entity recognition, and natural language inference. Some of these methods not only defend neural networks against adversarial attacks but also act as a regularization mechanism during training, saving the model from overfitting. This survey aims to review the various methods proposed for adversarial defenses in NLP over the past few years by introducing a novel taxonomy. The survey also highlights the fragility of advanced deep neural networks in NLP and the challenges involved in defending them.

研究动机与目标

  • 为应对深度神经网络在NLP中对对抗性扰动日益增长的脆弱性,即在输入变化极小的情况下导致误分类的问题。
  • 通过一种基于防御机制、扰动类型和鲁棒性认证的新型多维分类法,系统化并归类现有的NLP对抗性防御方法。
  • 评估对抗训练、同义词编码和认证鲁棒性等防御技术在提升模型对词替换及其他对抗攻击的抗干扰能力方面的有效性。
  • 突出显示部分防御方法兼具正则化机制的优势,可在模型训练过程中减少过拟合。
  • 识别在生成自然且难以察觉的对抗性样本方面的开放挑战,以及在离散、高维文本数据上实现认证鲁棒性的难题。

提出的方法

  • 提出一种新颖的分类法,基于防御机制(如对抗训练、输入变换)、扰动类型(词、字符、句子)和鲁棒性认证,对NLP中的对抗性防御进行分类。
  • 综述同义词编码方法,该方法将语义相似的词语映射到共享嵌入表示,通过在邻域区域内强制标签一致性,降低对同义词替换的敏感性。
  • 研究方向约束对抗训练(iAdvT),该方法将扰动限制在现有词嵌入空间内的方向,从而提升可解释性与鲁棒性。
  • 分析无需结构的认证鲁棒性方法SAFER,其利用同义词集合和嵌入空间中的最近邻来定义扰动集合,并训练具有形式化鲁棒性保证的模型。
  • 评估基于差分隐私的认证方法(wordDP),该方法将句子视为数据库,利用epsilon-DP来认证对词替换攻击的鲁棒性。
  • 综述对抗性基准数据集(如ANLI),其采用人机协同框架生成高质量、具有挑战性的对抗性样本,适用于自然语言推理任务。

实验结果

研究问题

  • RQ1如何基于其底层机制和扰动类型,系统性地对NLP中的对抗性防御进行分类?
  • RQ2同义词编码与嵌入邻域中的标签一致性在多大程度上能提升模型对词替换攻击的鲁棒性?
  • RQ3方向约束对抗训练是否能在不牺牲性能的前提下,同时提升NLP模型的鲁棒性与可解释性?
  • RQ4现有认证鲁棒性方法在处理子词和字符级模型时存在哪些局限性?SAFER如何克服这些局限?
  • RQ5差分隐私在文本分类和自然语言推理任务中,对词替换攻击是否能提供形式化、认证的鲁棒性保障?

主要发现

  • 同义词编码方法通过将语义相似的词语映射到共享表示,显著提升了鲁棒性,降低了对基于同义词的扰动的敏感性。
  • 方向约束对抗训练(iAdvT)在保持模型可解释性的同时,通过将扰动限制在有效词嵌入方向内,实现了比标准对抗训练更高的鲁棒性。
  • SAFER通过利用GLOVE嵌入中的同义词集合和最近邻关系定义扰动集合,为任意模型提供了无需结构的认证鲁棒性,对词替换攻击提供了形式化保证。
  • wordDP框架利用差分隐私提供了形式化的鲁棒性认证,确保若输入满足epsilon-DP约束,则模型预测在词替换下保持稳定。
  • ANLI基准通过人机协同流程成功生成了高质量的对抗性样本,当用于对抗训练时,显著提升了自然语言推理模型的鲁棒性。
  • 多种防御方法(包括对抗训练和同义词编码)也具有正则化作用,可减少过拟合并提升在干净数据上的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。