Skip to main content
QUICK REVIEW

[论文解读] Turn the Combination Lock: Learnable Textual Backdoor Attacks via Word Substitution

Fanchao Qi, Yuan Yao|arXiv (Cornell University)|Jun 11, 2021
Adversarial Robustness in Machine Learning参考文献 48被引用 9
一句话总结

本文提出可学习词替换(Learmable Word Substitution, LWS),一种新颖的文本后门攻击方法,通过学习最优同义词替换以形成触发器,将隐形后门注入NLP模型。该方法在保持语义连贯性的同时,实现接近100%的攻击成功率,且能逃避人类检查与现有防御机制的检测,暴露出NLP模型中关键的安全漏洞。

ABSTRACT

Recent studies show that neural natural language processing (NLP) models are vulnerable to backdoor attacks. Injected with backdoors, models perform normally on benign examples but produce attacker-specified predictions when the backdoor is activated, presenting serious security threats to real-world applications. Since existing textual backdoor attacks pay little attention to the invisibility of backdoors, they can be easily detected and blocked. In this work, we present invisible backdoors that are activated by a learnable combination of word substitution. We show that NLP models can be injected with backdoors that lead to a nearly 100% attack success rate, whereas being highly invisible to existing defense strategies and even human inspections. The results raise a serious alarm to the security of NLP models, which requires further research to be resolved. All the data and code of this paper are released at https://github.com/thunlp/BkdAtk-LWS.

研究动机与目标

  • 为解决现有文本后门攻击缺乏隐蔽性的问题,这些攻击通常使用显眼的、基于规则的触发器。
  • 开发一种后门机制,确保污染样本的语义连贯性和句法正确性。
  • 创建一种能逃避启发式防御机制和人类检查的后门。
  • 证明后门可基于数据流形自适应学习,从而提升攻击成功率与良性样本性能。
  • 揭示在第三方机器学习即服务(MLaaS)环境中,隐形后门对NLP模型造成的严重安全风险。

提出的方法

  • 采用触发器插入器与受害模型之间的联合训练框架,以注入后门。
  • 触发器插入器学习以形成稳定、可学习的组合触发器的方式替换词语为同义词。
  • 仅当特定的词语替换组合出现时,触发器才会被激活,类似于打开组合锁。
  • 使用HowNet和WordNet同义词词典生成同义词候选,提升数据污染能力与多样性。
  • 攻击以端到端方式训练,使触发器插入器能够适应数据分布并最大化攻击成功率。
  • 该方法保持语义含义与句法正确性,确保高度隐蔽性。

实验结果

研究问题

  • RQ1能否通过可学习的词语替换组合构建后门,使其保持语义连贯性和句法正确性?
  • RQ2此类后门在多大程度上可逃避现有防御机制与人类检查?
  • RQ3同义词词典的选择(如WordNet与HowNet)如何影响攻击成功率与鲁棒性?
  • RQ4该攻击能否在保持良性样本高性能的同时实现高成功率?
  • RQ5此类隐形后门对现实世界MLaaS部署中NLP模型的安全性与可信度有何影响?

主要发现

  • LWS攻击在多个真实世界数据集上实现了接近100%的攻击成功率,包括AG’s News(使用HowNet时ASR为99.6%)和SST-2(使用HowNet时ASR为97.2%)。
  • 即使在防御设置下,攻击仍保持强劲性能,使用HowNet时在AG’s News上的攻击成功率仍达95.3%。
  • 该攻击具有高度隐蔽性:污染样本在人类和启发式防御下几乎与良性样本无法区分。
  • 使用HowNet作为同义词词典的效果显著优于WordNet,不仅攻击成功率更高,且在防御环境下鲁棒性更强。
  • 该方法在实现高攻击成功率的同时,保持了高良性准确率(如SST-2上的CACC为88.6%),表明对干净数据的性能影响极小。
  • 全面分析确认,触发器并非基于固定规则模式,而是学习得到的、自适应的替换组合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。