[论文解读] Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models
本文提出了一种无需数据的NLP模型后门攻击方法,通过仅污染单个词嵌入向量,利用梯度下降技术构造一个超向量,当触发词出现时诱导模型产生恶意行为。该方法在保持干净准确率的同时实现了100%的攻击成功率,相较于以往的数据污染方法展现出更高的隐蔽性和效率。
Recent studies have revealed a security threat to natural language processing (NLP) models, called the Backdoor Attack. Victim models can maintain competitive performance on clean samples while behaving abnormally on samples with a specific trigger word inserted. Previous backdoor attacking methods usually assume that attackers have a certain degree of data knowledge, either the dataset which users would use or proxy datasets for a similar task, for implementing the data poisoning procedure. However, in this paper, we find that it is possible to hack the model in a data-free way by modifying one single word embedding vector, with almost no accuracy sacrificed on clean samples. Experimental results on sentiment analysis and sentence-pair classification tasks show that our method is more efficient and stealthier. We hope this work can raise the awareness of such a critical security risk hidden in the embedding layers of NLP models. Our code is available at https://github.com/lancopku/Embedding-Poisoning.
研究动机与目标
- 探究是否可以在不访问特定任务数据集的情况下执行NLP模型中的后门攻击。
- 探索词嵌入层作为低成本、高影响攻击面的脆弱性。
- 开发一种仅通过修改一个词嵌入向量来注入后门的方法,以最小化可检测性和模型干扰。
- 评估该攻击在微调和领域迁移场景下的鲁棒性。
- 提高对预训练NLP模型中污染嵌入所带来安全风险的认识。
提出的方法
- 攻击利用梯度下降优化单个词嵌入向量,以最大化模型在包含特定触发词的输入上的误分类概率。
- 构造的嵌入向量被直接替换到预训练模型的嵌入层中,无需数据污染或模型微调。
- 该方法在无需数据的环境中运行,不需访问目标数据集或代理数据。
- 攻击设计具有隐蔽性:在不包含触发词的干净输入上,模型预测结果保持不变。
- 该方法在多种NLP任务(包括情感分析和句子对分类)中进行了评估,涵盖多种设置(FDK、DS、DF)。
- 与现有后门攻击方法(如BadNets和RIPPLES)进行对比,以证明其在隐蔽性和有效性方面的优越性。
实验结果
研究问题
- RQ1是否可以通过仅修改一个词嵌入向量,在不访问任何训练数据的情况下成功将后门注入NLP模型?
- RQ2所提出的方法在不同NLP任务中实现100%攻击成功率的同时,能否保持高干净准确率?
- RQ3当模型在下游数据集上进行微调后,后门是否依然存在,特别是在源领域与目标领域不同的情况下?
- RQ4与基于数据污染的攻击相比,该方法在隐蔽性、效率和鲁棒性方面表现如何?
- RQ5该攻击是否真正实现了无需数据的环境,即在构造触发词时无需任何数据集?
主要发现
- 所提出的嵌入污染(EP)方法在完全无需数据(FDK)设置下,于情感分析和句子对分类任务中均实现了100%的攻击成功率。
- 所有设置下的干净准确率几乎保持不变,QNLI任务为91.56%,QQP任务为91.38%,显示出极高的隐蔽性。
- 即使在下游数据集(如IMDb和SST-2)上进行微调后,EP方法仍保持高攻击成功率(SST-2为100%,IMDb为98.84%)和高干净准确率(IMDb为93.23%)。
- 在领域迁移设置(DS)中,当污染数据集与目标数据集不同时(例如QNLI与QQP),EP方法仍实现100%攻击成功率,而BadNets则出现严重准确率下降(例如在QNLI上训练于QQP时准确率仅为26.97%)。
- DFEP变体(无需数据的嵌入污染)在所有测试设置中均实现100%攻击成功率并保持干净准确率,证实了该方法在真实世界数据受限场景下的鲁棒性和可行性。
- 结果表明,与传统数据污染方法相比,嵌入层污染是一种更高效、更隐蔽的攻击向量,因为它仅修改一个参数,并且在干净输入上保持了模型行为不变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。