Skip to main content
QUICK REVIEW

[论文解读] Hidden Backdoors in Human-Centric Language Models

Shaofeng Li, Hui Liu|arXiv (Cornell University)|May 1, 2021
Adversarial Robustness in Machine Learning参考文献 66被引用 5
一句话总结

本文提出两种新颖的隐藏后门攻击——同形异义字符攻击与动态句子攻击,旨在实现对人类检测的隐蔽性,同时在现代自然语言处理任务中实现高成功率。通过利用视觉欺骗与流畅文本生成,攻击在极低比例的污染数据下实现了高达97%的攻击成功率,揭示了以人类为中心的自然语言处理系统(如毒性评论检测、神经机器翻译与问答系统)存在严重安全漏洞。

ABSTRACT

Natural language processing (NLP) systems have been proven to be vulnerable to backdoor attacks, whereby hidden features (backdoors) are trained into a language model and may only be activated by specific inputs (called triggers), to trick the model into producing unexpected behaviors. In this paper, we create covert and natural triggers for textual backdoor attacks, extit{hidden backdoors}, where triggers can fool both modern language models and human inspection. We deploy our hidden backdoors through two state-of-the-art trigger embedding methods. The first approach via homograph replacement, embeds the trigger into deep neural networks through the visual spoofing of lookalike character replacement. The second approach uses subtle differences between text generated by language models and real natural text to produce trigger sentences with correct grammar and high fluency. We demonstrate that the proposed hidden backdoors can be effective across three downstream security-critical NLP tasks, representative of modern human-centric NLP systems, including toxic comment detection, neural machine translation (NMT), and question answering (QA). Our two hidden backdoor attacks can achieve an Attack Success Rate (ASR) of at least $97\%$ with an injection rate of only $3\%$ in toxic comment detection, $95.1\%$ ASR in NMT with less than $0.5\%$ injected data, and finally $91.12\%$ ASR against QA updated with only 27 poisoning data samples on a model previously trained with 92,024 samples (0.029\%). We are able to demonstrate the adversary's high success rate of attacks, while maintaining functionality for regular users, with triggers inconspicuous by the human administrators.

研究动机与目标

  • 为解决自然语言处理系统中缺乏人类不可见的后门触发机制的问题,特别是在安全关键应用场景中。
  • 开发隐蔽性强的后门攻击,使模型在正常输入下保持正常功能,仅在特定、自然外观的触发条件下激活。
  • 在多样化的现代自然语言处理任务(如毒性评论检测、神经机器翻译与问答)中评估这些攻击的有效性。
  • 证明基于计算机视觉的现有后门检测方法在自然语言处理中无效,原因在于结构与数据分布的显著差异。
  • 发布数据集与代码,以支持复现研究,并推动后门检测与防御机制的进一步探索。

提出的方法

  • 同形异义字符攻击通过使用视觉上相似的Unicode字符(同形异义字符)在字符级别嵌入触发信号,使人类难以察觉,但模型可识别。
  • 动态句子攻击利用先进的文本生成模型,生成语法正确、语言流畅的句子,以嵌入模仿自然语言模式的触发信号。
  • 在训练数据中以极低比例注入触发信号——毒性评论检测中为3%,神经机器翻译中低于0.5%,问答任务中仅27个样本,同时保持模型在干净输入上的性能。
  • 在三个下游任务上评估攻击效果:毒性评论检测、神经机器翻译(NMT)与问答(QA),使用预训练的BERT与T5模型。
  • 提出一种基于测量注入已知污染样本后异常输出率的启发式检测反制方法,并采用基于阈值的决策规则。
  • 通过特征空间分析可视化触发信号应用后隐藏表示的变化,确认模型内部状态中存在后门信号。
Figure 1 . An example of homographs.
Figure 1 . An example of homographs.

实验结果

研究问题

  • RQ1是否可以设计出对人类不可见但能有效触发现代自然语言处理模型恶意行为的后门触发机制?
  • RQ2这些隐藏后门攻击在多样化的现实世界自然语言处理任务(如毒性评论检测、NMT与QA)中效果如何?
  • RQ3基于计算机视觉的后门检测技术在多大程度上可被适配用于自然语言处理系统?
  • RQ4在保持模型可用性的前提下,实现高攻击成功率所需的最低数据注入比例是多少?
  • RQ5所提出的攻击是否能规避人工审查,在模型验证阶段保持不可见?

主要发现

  • 同形异义字符攻击在毒性评论检测任务中实现了97%的攻击成功率,仅使用3%的污染数据,同时保持了高流畅性与可读性。
  • 动态句子攻击在神经机器翻译任务中实现了95.1%的攻击成功率,数据注入比例低于0.5%,展现出高度隐蔽性与有效性。
  • 在问答任务中,仅使用27个污染样本(原模型训练数据为92,024个样本)即达到91.12%的攻击成功率,相当于0.029%的注入率。
  • 由于触发信号具备自然语言质量,且同形异义字符攻击中具有视觉相似性,人类审查员无法察觉后门触发信号。
  • 特征空间分析表明,污染样本在最后一层激活空间中向干净负样本方向发生偏移,证实了后门信号已成功注入模型内部状态。
  • 基于测量注入已知污染样本后异常输出率的启发式检测方法,在已知攻击类型下展现出作为实用防御机制的潜力。
Figure 2 . Backdoor attacks on modern language models (LMs) based services.
Figure 2 . Backdoor attacks on modern language models (LMs) based services.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。