[论文解读] Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic Trigger
本文提出了一种新颖的文本后门攻击方法,利用句法结构作为不可见触发器,在显著提升隐蔽性与防御抵抗能力的同时,实现了接近完美的攻击成功率(高达100%),相较于基于插入的方法具有明显优势。通过将输入改写为匹配预定义句法模板的形式,该方法保持了文本的流畅性与语法正确性,使污染样本难以被标准过滤机制或句子级防御手段检测到。
Backdoor attacks are a kind of insidious security threat against machine learning models. After being injected with a backdoor in training, the victim model will produce adversary-specified outputs on the inputs embedded with predesigned triggers but behave properly on normal inputs during inference. As a sort of emergent attack, backdoor attacks in natural language processing (NLP) are investigated insufficiently. As far as we know, almost all existing textual backdoor attack methods insert additional contents into normal samples as triggers, which causes the trigger-embedded samples to be detected and the backdoor attacks to be blocked without much effort. In this paper, we propose to use the syntactic structure as the trigger in textual backdoor attacks. We conduct extensive experiments to demonstrate that the syntactic trigger-based attack method can achieve comparable attack performance (almost 100% success rate) to the insertion-based methods but possesses much higher invisibility and stronger resistance to defenses. These results also reveal the significant insidiousness and harmfulness of textual backdoor attacks. All the code and data of this paper can be obtained at https://github.com/thunlp/HiddenKiller.
研究动机与目标
- 为解决NLP中缺乏有效且不可见的文本后门攻击方法,特别是能够规避检测与防御的问题。
- 探究句法结构是否可作为比插入文本标记更具隐蔽性与鲁棒性的触发器。
- 证明句法触发器在保持模型在干净输入上性能的同时,仍能实现高攻击成功率。
- 评估句法触发攻击对新兴句子级后门防御机制的鲁棒性。
- 揭示此类攻击的隐蔽性与危害性,并呼吁加强NLP安全领域的防御措施。
提出的方法
- 该方法通过使用句法受控的改写模型对正常输入进行改写,以匹配预定义的句法模板(例如:S(SBAR)(,)(NP)(VP)(.)),生成污染的训练样本。
- 句法触发器以结构模式的形式编码,而非标记序列,使其在语义与句法层面均保持隐蔽。
- 在推理阶段,测试样本也通过相同句法模板进行改写,以激活后门。
- 该方法利用预训练模型(如BERT),并在包含句法转换样本的数据增强后进行微调。
- 评估了两种句子级防御机制:后向翻译改写与基于目标SCP的防御,以中和句法触发器。
- 在SST-2及其他NLP基准数据集上,通过自动评估与人工评估相结合的方式,评估了攻击的流畅性与成功率。
实验结果
研究问题
- RQ1句法结构能否作为NLP中有效且不可见的文本后门攻击触发器?
- RQ2与基于插入的方法相比,基于句法触发器的攻击在成功率与流畅性方面表现如何?
- RQ3基于句法触发器的攻击在多大程度上能抵抗当前最先进的句子级后门防御?
- RQ4与标记插入方法相比,句法触发器对污染样本的语法正确性与自然性有何影响?
- RQ5此类攻击对预训练模型在现实世界NLP应用中的安全性与可信度有何深远影响?
主要发现
- 基于句法触发器的攻击在SST-2数据集上实现了100%的攻击成功率,与基于插入的基线方法相当或更优。
- 采用句法触发器的污染样本展现出显著更高的流畅性与语法正确性,使其更难通过人工或自动检测手段识别。
- 该攻击在面对句子级防御机制(包括后向翻译与目标化改写防御)时,仍保持超过90%的成功率,而基线方法的性能下降至约50%。
- 该方法对依赖检测不自然或插入标记的数据过滤与检测技术表现出极强的抵抗力。
- 模型在干净输入上的准确率基本不受影响,证实了该攻击在良性输入上的高度隐蔽性。
- 人工评估结果表明,采用句法触发器的污染样本在流畅性与连贯性方面与正常自然语句无异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。