Skip to main content
QUICK REVIEW

[论文解读] Bridge the Gap Between CV and NLP! A Gradient-based Textual Adversarial Attack Framework

Lifan Yuan, Yichi Zhang|arXiv (Cornell University)|Oct 28, 2021
Adversarial Robustness in Machine Learning被引用 11
一句话总结

本文提出了一种统一的基于梯度的对抗攻击框架,通过在连续嵌入空间中优化扰动,并利用掩码语言模型解码,将计算机视觉与自然语言处理相连接,生成流畅、语法正确的对抗性文本。该方法 T-PGD 在迁移黑盒设置下实现了最先进水平的攻击成功率,优于强基线方法,同时保持了较高的文本质量。

ABSTRACT

Despite recent success on various tasks, deep learning techniques still perform poorly on adversarial examples with small perturbations. While optimization-based methods for adversarial attacks are well-explored in the field of computer vision, it is impractical to directly apply them in natural language processing due to the discrete nature of the text. To address the problem, we propose a unified framework to extend the existing optimization-based adversarial attack methods in the vision domain to craft textual adversarial samples. In this framework, continuously optimized perturbations are added to the embedding layer and amplified in the forward propagation process. Then the final perturbed latent representations are decoded with a masked language model head to obtain potential adversarial samples. In this paper, we instantiate our framework with an attack algorithm named Textual Projected Gradient Descent (T-PGD). We find our algorithm effective even using proxy gradient information. Therefore, we perform the more challenging transfer black-box attack and conduct comprehensive experiments to evaluate our attack algorithm with several models on three benchmark datasets. Experimental results demonstrate that our method achieves overall better performance and produces more fluent and grammatical adversarial samples compared to strong baseline methods. The code and data are available at \url{https://github.com/Phantivia/T-PGD}.

研究动机与目标

  • 为弥合计算机视觉(CV)与自然语言处理(NLP)中对抗攻击方法之间的差距,其中离散文本限制了基于梯度的优化。
  • 解决在仅能访问模型决策而无法获取梯度的黑盒设置下,生成有效且流畅的对抗性文本的挑战。
  • 开发一种可泛化的框架,通过在连续嵌入空间而非离散标记上操作,实现在 NLP 中的基于优化的攻击。
  • 通过利用代理模型和掩码语言建模进行解码,提升 NLP 中对抗攻击的可迁移性和鲁棒性。
  • 生成既高度有效又语言连贯的对抗样本,超越基于启发式或离散替换的方法。

提出的方法

  • 该框架在连续嵌入空间中运行,直接对标记嵌入应用基于梯度的扰动,而非离散标记。
  • 通过神经网络的前向传播放大扰动,增强其对最终隐藏表示的影响。
  • 使用掩码语言模型(MLM)头将扰动后的潜在表示解码回离散、流畅且语法正确的文本。
  • 当无法获取真实目标模型的梯度时,攻击使用本地代理模型生成梯度信号,从而实现仅基于决策的黑盒攻击。
  • 该方法具体实现为 T-PGD,即 PGD 的一种变体,利用代理梯度和 MLM 解码生成高质量的对抗样本。
  • 通过在与目标模型不同的数据集上训练代理模型,该框架实现了跨不同数据集和模型的迁移攻击,模拟了真实世界中的约束条件。

实验结果

研究问题

  • RQ1尽管文本具有离散性,是否能够有效将来自计算机视觉的基于梯度的对抗攻击方法适配到自然语言处理中?
  • RQ2如何在嵌入空间中优化对抗扰动,以生成高质量、流畅且语法正确的对抗性文本?
  • RQ3在仅能访问模型预测而无法获取梯度的黑盒设置下,对抗攻击的可迁移性在多大程度上得以实现?
  • RQ4掩码语言模型头是否能够有效从扰动后的潜在表示中重建出连贯的对抗性文本?
  • RQ5在多种模型和数据集上,所提出的 T-PGD 方法在攻击成功率、流畅性和语法正确性方面与强基线相比表现如何?

主要发现

  • 当使用在不同模型上生成的对抗样本攻击 BERT 时,T-PGD 在 RoBERTa 上实现了 45.29% 的攻击成功率,显著优于基线方法。
  • 在 SST-2 数据集上,当本地代理模型在相同数据集上训练时,T-PGD 实现了 97.00% 的攻击成功率,表现出极高的有效性。
  • 该方法生成的对抗样本平均困惑度(PPL)为 343.65,表明其流畅性和语法正确性优于基线方法。
  • 在不同数据集(如 IMDB、Amazon)之间的迁移设置中,T-PGD 保持了强劲表现,攻击成功率分别为 93.30% 和 96.40%。
  • 该框架成功实现了仅基于模型预测的决策型黑盒攻击,证明即使在无法访问目标模型梯度的情况下依然有效。
  • 使用 MLM 头显著提升了对抗性文本的质量,确保其在经历扰动后仍保持流畅和语法正确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。