Skip to main content
QUICK REVIEW

[论文解读] Generating Natural Language Adversarial Examples through An Improved Beam Search Algorithm

Tengfei Zhao, Zhaocheng Ge|arXiv (Cornell University)|Oct 15, 2021
Adversarial Robustness in Machine Learning参考文献 31被引用 5
一句话总结

本文提出了一种改进的束搜索算法,用于在黑盒设置下生成高质量、低扰动的自然语言对抗性样本。通过优化搜索策略并利用 Sentiwordnet 相似度进行词替换评分,该方法在 IMDB 数据集上对 BERT 和 BiLSTM 实现了 100% 的攻击成功率,查询次数仅为当前最先进基线方法的 1/15 至 1/3,显著提升了效率,同时不降低成功率或迁移能力。

ABSTRACT

The research of adversarial attacks in the text domain attracts many interests in the last few years, and many methods with a high attack success rate have been proposed. However, these attack methods are inefficient as they require lots of queries for the victim model when crafting text adversarial examples. In this paper, a novel attack model is proposed, its attack success rate surpasses the benchmark attack methods, but more importantly, its attack efficiency is much higher than the benchmark attack methods. The novel method is empirically evaluated by attacking WordCNN, LSTM, BiLSTM, and BERT on four benchmark datasets. For instance, it achieves a 100\% attack success rate higher than the state-of-the-art method when attacking BERT and BiLSTM on IMDB, but the number of queries for the victim models only is 1/4 and 1/6.5 of the state-of-the-art method, respectively. Also, further experiments show the novel method has a good transferability on the generated adversarial examples.

研究动机与目标

  • 解决现有黑盒词级别对抗性攻击方法效率低下的问题,其需要过多的模型查询。
  • 提升攻击成功率,尤其是在 IMDB 和 SST-2 等短文本数据集上,此前方法表现不佳。
  • 在生成的对抗性样本中保持高语义相似度和低扰动,以确保自然性和质量。
  • 增强对抗性样本在不同模型间的迁移能力,例如从 BERT 迁移到 DistilBERT。
  • 设计一种查询高效的攻击策略,在保持高攻击有效性的同时降低计算成本。

提出的方法

  • 提出一种改进的束搜索算法,以提升黑盒文本攻击场景下的搜索效率和成功率。
  • 设计一种基于 Sentiwordnet 的新型词替换评分机制,优先选择语义相似度高且扰动小的同义词。
  • 为长文本和短文本分别设计攻击策略,以适应不同输入的复杂性,并提升对短序列的攻击成功率。
  • 通过束宽优化平衡探索与利用,在束宽仅为 1 时也能实现高攻击成功率。
  • 集成基于置信度的选择机制,引导搜索过程朝向能成功欺骗目标模型的对抗性样本。
  • 在仅可访问模型预测结果(而非梯度)的黑盒设置下实施攻击,模拟真实世界约束条件。

实验结果

研究问题

  • RQ1改进的束搜索算法是否能显著减少生成有效黑盒 NLP 对抗性样本所需的查询次数?
  • RQ2所提方法是否在 IMDB 和 SST-2 等短文本数据集上优于当前最先进基线方法,实现更高的攻击成功率?
  • RQ3基于 Sentiwordnet 相似度的使用在多大程度上提升了对抗性样本的质量和自然性?
  • RQ4与标准束搜索相比,改进的束搜索在攻击成功率和效率方面表现如何?
  • RQ5所提方法生成的对抗性样本是否展现出强迁移能力,例如在 DistilBERT 上?

主要发现

  • 在 IMDB 数据集上,该方法对 BERT 和 BiLSTM 实现了 100% 的攻击成功率,优于所有基线方法。
  • 在 IMDB 上,该方法将查询次数减少至基线 SememePSO 的 1/15 和 PWWS 的 1/3,攻击速度提升 3–15 倍。
  • 在 SST-2 数据集上,该方法实现了 91.6% 的攻击成功率,高于所有对比基线方法。
  • 即使在束宽 = 1 时,改进的束搜索算法也优于标准束搜索在束宽 = 6 时的表现,成功率更高。
  • 该方法生成的对抗性样本具有较低的困惑度和较高的语法正确性,表明其语言质量优异。
  • 对抗性样本的迁移能力与当前最先进方法 SememePSO 相当,在 IMDB、SST-2、YELP 和 SNLI 数据集上对 DistilBERT 的成功率相近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。