Skip to main content
QUICK REVIEW

[论文解读] Generating Natural Language Attacks in a Hard Label Black Box Setting

Rishabh Maheshwary, Saket Maheshwary|arXiv (Cornell University)|Dec 29, 2020
Topic Modeling被引用 4
一句话总结

本文提出了一种在仅可访问最高预测标签的硬标签黑盒设置下,针对自然语言处理模型的基于决策的对抗攻击方法。通过使用基于遗传算法的群体优化与基于同义词的初始化,该方法生成了语义相似、语法正确的对抗样本,且扰动率低,成功率高,在无需替代模型或训练数据的极度受限环境中,优于先前方法。

ABSTRACT

We study an important and challenging task of attacking natural language processing models in a hard label black box setting. We propose a decision-based attack strategy that crafts high quality adversarial examples on text classification and entailment tasks. Our proposed attack strategy leverages population-based optimization algorithm to craft plausible and semantically similar adversarial examples by observing only the top label predicted by the target model. At each iteration, the optimization procedure allow word replacements that maximizes the overall semantic similarity between the original and the adversarial text. Further, our approach does not rely on using substitute models or any kind of training data. We demonstrate the efficacy of our proposed approach through extensive experimentation and ablation studies on five state-of-the-art target models across seven benchmark datasets. In comparison to attacks proposed in prior literature, we are able to achieve a higher success rate with lower word perturbation percentage that too in a highly restricted setting.

研究动机与目标

  • 解决在仅可观测最高预测标签的硬标签黑盒设置下,生成有效对抗样本的挑战。
  • 开发一种攻击策略,在最小化词元扰动的同时,保持高语义相似度和语法正确性。
  • 消除对替代模型、训练数据或梯度信息的依赖,使攻击在实际应用中更具可行性。
  • 评估最先进NLP模型在该严格但现实的攻击场景下的鲁棒性。
  • 展示所提攻击在多种模型和数据集上的可迁移性与有效性。

提出的方法

  • 采用基于群体的优化框架,通过迭代的词元替换演化候选对抗样本。
  • 使用遗传算法(GA)探索搜索空间,并收敛至语义相似度更高的优质对抗样本。
  • 利用来自对抗拟合词嵌入空间的前50个同义词进行同义词初始化,以提升初始解的质量。
  • 在优化过程中,使用基于嵌入的相似度度量最大化原始文本与对抗文本之间的语义相似度。
  • 仅依赖目标模型的硬标签反馈(最高预测类别),不访问梯度、置信度分数或模型架构信息。
  • 通过策略性选择词语并施加替换约束,缩小搜索空间,以提升收敛速度与效率。

实验结果

研究问题

  • RQ1在仅提供最高标签反馈的硬标签黑盒设置下,基于决策的攻击能否生成高质量的对抗样本?
  • RQ2在严格约束下,基于群体的优化策略在保持语义相似度与语法正确性方面有多有效?
  • RQ3基于同义词的初始化在多大程度上提升了对抗样本生成的质量与效率?
  • RQ4与先前方法相比,所提攻击在成功率、扰动率与可迁移性方面表现如何?
  • RQ5该方法生成的对抗样本能否在不同NLP模型与数据集之间成功迁移?

主要发现

  • 与非GA优化相比,该方法在BERT上实现了4.4%的扰动率降低与0.16的语义相似度提升,证明了遗传算法集成的有效性。
  • 若无基于同义词的初始化,平均语义相似度下降0.1,扰动率上升2.4%,证实其对解质量的重要性。
  • 该方法生成的对抗样本表现出更高的可迁移性,在SNLI数据集上对其他模型的攻击成功率分别为:BERT为53.0%,ESIM为54.9%,Infersent为67.4%。
  • 人工评估显示,IMDB数据集上96%的对抗样本与原始样本被分类为同一标签,SNLI数据集上为92%,表明语义保留性极强。
  • 平均语法正确性得分为4.44(IMDB)与4.13(SNLI),语义相似度分别为0.93与0.896,证实其语言流畅性与合理性俱佳。
  • 在使用10%的对抗样本进行对抗训练后,BERT的准确率下降15%,扰动率上升10%,表明该攻击在模型微调后仍具有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。