Skip to main content
QUICK REVIEW

[论文解读] BERT is Robust! A Case Against Synonym-Based Adversarial Examples in Text Classification

Jens Hauser, Zhao Meng|arXiv (Cornell University)|Sep 15, 2021
Adversarial Robustness in Machine Learning被引用 10
一句话总结

本文表明,大多数针对 BERT 的同义词对抗攻击并未保持语义含义,其中 96–99% 的扰动在语义上无效。本文提出一种双管齐下的防御策略:在训练过程中使用类似攻击的样本进行数据增强,并结合后处理步骤,将最先进攻击的成功率降低至 5% 以下,同时保持较高的干净准确率。

ABSTRACT

Deep Neural Networks have taken Natural Language Processing by storm. While this led to incredible improvements across many tasks, it also initiated a new research field, questioning the robustness of these neural networks by attacking them. In this paper, we investigate four word substitution-based attacks on BERT. We combine a human evaluation of individual word substitutions and a probabilistic analysis to show that between 96% and 99% of the analyzed attacks do not preserve semantics, indicating that their success is mainly based on feeding poor data to the model. To further confirm that, we introduce an efficient data augmentation procedure and show that many adversarial examples can be prevented by including data similar to the attacks during training. An additional post-processing step reduces the success rates of state-of-the-art attacks below 5%. Finally, by looking at more reasonable thresholds on constraints for word substitutions, we conclude that BERT is a lot more robust than research on attacks suggests.

研究动机与目标

  • 调查针对 BERT 的同义词对抗攻击是否保持原始文本的语义含义,以挑战此类攻击揭示模型漏洞的假设。
  • 评估在训练过程中使用类似攻击样本的数据增强作为防御机制的有效性。
  • 提出一种轻量级、可扩展的防御策略,结合数据增强与后处理,以降低攻击成功率,同时不牺牲干净准确率。
  • 质疑对抗性 NLP 领域的研究激励机制,即高攻击成功率被优先考虑,而非语义有效性。

提出的方法

  • 对四种同义词攻击中使用的单个词语替换进行人工评估,以衡量语义保持程度。
  • 使用对抗性拟合词向量和通用句子编码器(USE)进行概率分析,测量原始文本与扰动文本之间的语义相似度。
  • 实施一种数据增强流程,在训练期间生成合成对抗性样本,以提升模型鲁棒性。
  • 应用后处理步骤,基于置信度分数检测对抗性样本,从而降低攻击成功率。
  • 将所提出的防御方法与传统对抗性训练(ADV naive 和 ADV on-the-fly)在鲁棒性和计算效率方面进行比较。
  • 使用余弦相似度(对抗性拟合词向量)和 USE 句子嵌入等指标,量化语义相似度与攻击有效性。

实验结果

研究问题

  • RQ1针对 BERT 的同义词对抗攻击在多大程度上保持了原始文本的语义含义?
  • RQ2在训练过程中使用类似攻击样本的数据增强是否能显著提升模型对对抗攻击的鲁棒性?
  • RQ3后处理步骤在模型推理后检测对抗性样本方面有多有效?
  • RQ4所提出的防御方法在鲁棒性和计算效率方面是否优于传统对抗性训练?
  • RQ5为何高成功率攻击常产生语义不连贯的扰动?这对评估模型鲁棒性有何影响?

主要发现

  • 通过人工评估和概率相似度分析确认,四种同义词攻击在 BERT 上生成的对抗性样本中,有 96% 至 99% 未能保持原始文本的语义含义。
  • 所提出的数据显示增强程序通过在训练期间向模型暴露类似攻击的数据,有效防止了大量对抗性样本,其在 Yelp 数据集上的鲁棒性优于传统对抗性训练。
  • 后处理步骤将最先进攻击的成功率降低至 5% 以下,展现出强大的检测能力。
  • 该防御方法计算效率高,尽管训练数据量翻倍,训练时间仅增加约 50%,在速度和可扩展性方面优于标准对抗性训练。
  • 本研究揭示,研究人员往往优先考虑高攻击成功率而非语义有效性,这削弱了 NLP 中对抗性样本的实质性意义。
  • 即使攻击修改了多达 40% 的词语,生成的扰动仍常在语义上不连贯,表明当前攻击成功率更多由数据质量而非模型脆弱性驱动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。