Skip to main content
QUICK REVIEW

[论文解读] Poison Attacks against Text Datasets with Conditional Adversarially Regularized Autoencoder

Alvin Chan, Yi Tay|arXiv (Cornell University)|Oct 6, 2020
Adversarial Robustness in Machine Learning参考文献 37被引用 5
一句话总结

本文提出一种基于条件对抗正则化自编码器(CARA)的后门投毒攻击方法,通过操纵潜在表征,将细微且逼真的投毒签名注入文本数据集,实现对NLP模型的投毒。仅使用1%的投毒训练数据,该攻击在存在投毒触发词时,即可使基于BERT的分类器将预测结果引导至目标类别,成功率超过80%,暴露出自然语言理解与文本分类系统中的关键安全漏洞。

ABSTRACT

This paper demonstrates a fatal vulnerability in natural language inference (NLI) and text classification systems. More concretely, we present a 'backdoor poisoning' attack on NLP models. Our poisoning attack utilizes conditional adversarially regularized autoencoder (CARA) to generate poisoned training samples by poison injection in latent space. Just by adding 1% poisoned data, our experiments show that a victim BERT finetuned classifier's predictions can be steered to the poison target class with success rates of >80% when the input hypothesis is injected with the poison signature, demonstrating that NLI and text classification systems face a huge security risk.

研究动机与目标

  • 证明最先进的NLP模型(如BERT、RoBERTa和XLNet)可通过数据投毒方式遭受后门投毒攻击。
  • 解决生成真实、语法正确的投毒文本样本的挑战,使其在保持模型性能的同时避免被检测。
  • 开发一种条件生成框架,将投毒签名嵌入句子对的潜在空间,确保生成结果的连贯性与可控性。
  • 评估NLP模型在投毒攻击下的鲁棒性,并强调在模型设计中亟需增强抗投毒能力。

提出的方法

  • 提出一种条件对抗正则化自编码器(CARA),学习文本序列的平滑、解耦潜在表征,以实现可控生成。
  • 采用对抗正则化,确保投毒注入后生成的句子在语义上保持连贯且语法正确。
  • 将解码过程同时基于前提和目标标签进行条件化,实现对投毒假设句的定向生成。
  • 在潜在空间中注入投毒签名,而非直接修改原始文本,从而保持真实性并降低被检测的可能性。
  • 采用变分自编码器框架结合对抗训练,对潜在空间进行正则化,提升生成质量。
  • 在标准NLI数据集(SNLI、MNLI)和Yelp数据集上进行训练,随后在投毒版本上微调BERT、RoBERTa和XLNet,以评估攻击成功率。

实验结果

研究问题

  • RQ1能否通过真实、连贯的文本样本成功执行NLP模型的后门投毒攻击,且能有效规避检测?
  • RQ2像CARA这样的生成模型能否在句子对数据的潜在空间中有效嵌入投毒签名,同时保持语义连贯性?
  • RQ3当训练数据中仅含1%的投毒样本时,最先进的NLP模型(如BERT、RoBERTa和XLNet)在多大程度上仍保持鲁棒性?
  • RQ4攻击成功率如何随不同的投毒注入率和签名范数变化?
  • RQ5该同种投毒技术能否推广至其他NLP任务,如机器翻译或问答系统?

主要发现

  • 仅使用1%的投毒训练数据,该攻击在所有评估模型中对注入触发词的样本分类为目标类别的成功率超过99%。
  • 在MNLI开发集(dev-matched set)上,BERT、RoBERTa和XLNet在10%投毒样本下均实现了超过99%的触发攻击成功率。
  • 即使投毒比例达到5%,模型对目标类别的预测成功率仍保持在98%以上,表明攻击具有极高的有效性。
  • 模型在干净开发集上的性能几乎保持不变(例如,干净模型在SNLI开发集上的准确率约为54%),表明在干净数据上无明显性能下降。
  • 攻击成功率随投毒注入率提高和触发签名范数增大而上升,证实了攻击的可控性。
  • 相同模型架构的基线版与大模型版本之间未观察到显著的攻击成功率差异,表明该漏洞在不同规模下均具有一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。