Skip to main content
QUICK REVIEW

[论文解读] Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models

Wenkai Yang, Lei Li|arXiv (Cornell University)|Mar 29, 2021
Adversarial Robustness in Machine Learning参考文献 23被引用 11
一句话总结

本文提出了一种无需数据的NLP模型后门攻击方法,通过仅污染单个词嵌入向量,利用梯度下降技术构造一个超向量,当触发词出现时诱导模型产生恶意行为。该方法在保持干净准确率的同时实现了100%的攻击成功率,相较于以往的数据污染方法展现出更高的隐蔽性和效率。

ABSTRACT

Recent studies have revealed a security threat to natural language processing (NLP) models, called the Backdoor Attack. Victim models can maintain competitive performance on clean samples while behaving abnormally on samples with a specific trigger word inserted. Previous backdoor attacking methods usually assume that attackers have a certain degree of data knowledge, either the dataset which users would use or proxy datasets for a similar task, for implementing the data poisoning procedure. However, in this paper, we find that it is possible to hack the model in a data-free way by modifying one single word embedding vector, with almost no accuracy sacrificed on clean samples. Experimental results on sentiment analysis and sentence-pair classification tasks show that our method is more efficient and stealthier. We hope this work can raise the awareness of such a critical security risk hidden in the embedding layers of NLP models. Our code is available at https://github.com/lancopku/Embedding-Poisoning.

研究动机与目标

  • 探究是否可以在不访问特定任务数据集的情况下执行NLP模型中的后门攻击。
  • 探索词嵌入层作为低成本、高影响攻击面的脆弱性。
  • 开发一种仅通过修改一个词嵌入向量来注入后门的方法,以最小化可检测性和模型干扰。
  • 评估该攻击在微调和领域迁移场景下的鲁棒性。
  • 提高对预训练NLP模型中污染嵌入所带来安全风险的认识。

提出的方法

  • 攻击利用梯度下降优化单个词嵌入向量,以最大化模型在包含特定触发词的输入上的误分类概率。
  • 构造的嵌入向量被直接替换到预训练模型的嵌入层中,无需数据污染或模型微调。
  • 该方法在无需数据的环境中运行,不需访问目标数据集或代理数据。
  • 攻击设计具有隐蔽性:在不包含触发词的干净输入上,模型预测结果保持不变。
  • 该方法在多种NLP任务(包括情感分析和句子对分类)中进行了评估,涵盖多种设置(FDK、DS、DF)。
  • 与现有后门攻击方法(如BadNets和RIPPLES)进行对比,以证明其在隐蔽性和有效性方面的优越性。

实验结果

研究问题

  • RQ1是否可以通过仅修改一个词嵌入向量,在不访问任何训练数据的情况下成功将后门注入NLP模型?
  • RQ2所提出的方法在不同NLP任务中实现100%攻击成功率的同时,能否保持高干净准确率?
  • RQ3当模型在下游数据集上进行微调后,后门是否依然存在,特别是在源领域与目标领域不同的情况下?
  • RQ4与基于数据污染的攻击相比,该方法在隐蔽性、效率和鲁棒性方面表现如何?
  • RQ5该攻击是否真正实现了无需数据的环境,即在构造触发词时无需任何数据集?

主要发现

  • 所提出的嵌入污染(EP)方法在完全无需数据(FDK)设置下,于情感分析和句子对分类任务中均实现了100%的攻击成功率。
  • 所有设置下的干净准确率几乎保持不变,QNLI任务为91.56%,QQP任务为91.38%,显示出极高的隐蔽性。
  • 即使在下游数据集(如IMDb和SST-2)上进行微调后,EP方法仍保持高攻击成功率(SST-2为100%,IMDb为98.84%)和高干净准确率(IMDb为93.23%)。
  • 在领域迁移设置(DS)中,当污染数据集与目标数据集不同时(例如QNLI与QQP),EP方法仍实现100%攻击成功率,而BadNets则出现严重准确率下降(例如在QNLI上训练于QQP时准确率仅为26.97%)。
  • DFEP变体(无需数据的嵌入污染)在所有测试设置中均实现100%攻击成功率并保持干净准确率,证实了该方法在真实世界数据受限场景下的鲁棒性和可行性。
  • 结果表明,与传统数据污染方法相比,嵌入层污染是一种更高效、更隐蔽的攻击向量,因为它仅修改一个参数,并且在干净输入上保持了模型行为不变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。