Skip to main content
QUICK REVIEW

[论文解读] CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation

Tianlu Wang, Xuezhi Wang|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 25被引用 7
一句话总结

CAT-Gen 提出了一种受控对抗性文本生成框架,通过使用与任务无关的可控属性(例如情感分类中的产品类别)生成多样且流畅的对抗性样本,从而提升 NLP 模型的鲁棒性。通过将属性学习与攻击生成解耦,并利用预训练语言模型,CAT-Gen 生成的对抗性样本在流畅性、多样性以及在模型微调和架构变化下的迁移能力方面均优于现有方法。

ABSTRACT

NLP models are shown to suffer from robustness issues, i.e., a model's prediction can be easily changed under small perturbations to the input. In this work, we present a Controlled Adversarial Text Generation (CAT-Gen) model that, given an input text, generates adversarial texts through controllable attributes that are known to be invariant to task labels. For example, in order to attack a model for sentiment classification over product reviews, we can use the product categories as the controllable attribute which would not change the sentiment of the reviews. Experiments on real-world NLP datasets demonstrate that our method can generate more diverse and fluent adversarial texts, compared to many existing adversarial text generation approaches. We further use our generated adversarial examples to improve models through adversarial training, and we demonstrate that our generated attacks are more robust against model re-training and different model architectures.

研究动机与目标

  • 解决现有对抗性文本生成方法在通过词替换或连续表示扰动输入时存在的多样性与流畅性不足问题。
  • 通过生成语义上接近原始输入但能欺骗分类器的高质量对抗性样本,提升模型鲁棒性。
  • 通过生成对模型微调和架构变化具有鲁棒性的对抗性样本,实现鲁棒性评估与训练。
  • 通过使用预设的、与标签无关的属性(例如领域、性别、类别)来引导文本生成,实现属性学习与攻击生成的解耦。
  • 证明受控属性操作可带来更有效的对抗性训练,并在不同模型间实现更强的泛化能力。

提出的方法

  • 采用在大规模语料上预训练的编码器-解码器架构,以生成流畅且多样的对抗性文本。
  • 引入一个模块化网络,用于编码已知与主要任务标签无关的可控属性(例如产品类别、性别)。
  • 通过将输入文本和指定属性同时作为条件输入解码器,控制文本生成过程,实现有针对性的扰动。
  • 使用辅助数据集训练属性模块,无需平行数据,从而实现属性的解耦学习。
  • 优化生成过程,以在最小化与原始输入在语义和句法空间中偏差的同时,最大化攻击成功率。
  • 使用语言模型困惑度和 BLEU-4 分数作为自动指标,评估生成的对抗性样本的流畅性与多样性。

实验结果

研究问题

  • RQ1与词替换或嵌入级扰动相比,文本生成中的受控属性操作是否能产生更流畅、更多样化的对抗性样本?
  • RQ2在模型微调和架构变化下,CAT-Gen 生成的对抗性样本的鲁棒性与现有方法相比如何?
  • RQ3CAT-Gen 生成的对抗性样本在多大程度上能通过对抗性训练提升模型鲁棒性?
  • RQ4使用预设的、与任务无关的属性是否能带来更语义一致且可迁移的对抗性攻击?
  • RQ5该框架能否扩展至自动识别无需人工指定的脆弱属性?

主要发现

  • CAT-Gen 生成的对抗性样本困惑度显著低于 TextFooler(1853.7)和 NL-adv(964.3),例如在 Language Model 1 上仅为 729.5,表明其流畅性更高。
  • CAT-Gen 的 BLEU-4 分数(38.8)高于 TextFooler(68.9)和 NL-adv(64.3),表明其生成输出的多样性更强。
  • 在微调后的 WordCNN 模型上,CAT-Gen 攻击的攻击成功率保持在 49.3%,优于 TextFooler(84.7%)和 NL-adv(82.9%),显示出更强的迁移能力。
  • 在不同架构(WordLSTM)上测试时,CAT-Gen 攻击的成功率最低(51.5%),表明其对架构变化具有更强的鲁棒性。
  • 使用 CAT-Gen 生成的对抗性样本进行对抗性训练,可使模型在保留的对抗性测试集上的准确率达到 92.5%,显著优于基线方法(例如使用 TextFooler 增广时仅为 52.7%)。
  • 使用 CAT-Gen 样本训练的模型在其他方法生成的攻击下仍保持高准确率(84.4–83.4),显示出强大的泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。