[论文解读] Defending Against Backdoor Attacks in Natural Language Generation
本文提出了一种针对自然语言生成(NLG)系统中后门攻击的新型防御方法,特别适用于机器翻译和对话生成任务。通过利用从目标输出生成源输入的后向概率,该方法有效检测并缓解了多种攻击类型的后门触发器,优于现有方法——尤其在处理对话生成中的一对多特性方面表现突出——且无需微调或辅助模型。
The frustratingly fragile nature of neural network models make current natural language generation (NLG) systems prone to backdoor attacks and generate malicious sequences that could be sexist or offensive. Unfortunately, little effort has been invested to how backdoor attacks can affect current NLG models and how to defend against these attacks. In this work, by giving a formal definition of backdoor attack and defense, we investigate this problem on two important NLG tasks, machine translation and dialog generation. Tailored to the inherent nature of NLG models (e.g., producing a sequence of coherent words given contexts), we design defending strategies against attacks. We find that testing the backward probability of generating sources given targets yields effective defense performance against all different types of attacks, and is able to handle the {\it one-to-many} issue in many NLG tasks such as dialog generation. We hope that this work can raise the awareness of backdoor risks concealed in deep NLG systems and inspire more future work (both attack and defense) towards this direction.
研究动机与目标
- 研究神经自然语言生成(NLG)系统在后门攻击下的脆弱性,此类攻击可能导致生成有攻击性或偏见的输出。
- 在NLG背景下正式定义后门攻击与防御机制,解决序列生成和一对多映射等独特挑战。
- 开发并评估针对NLG固有特性(如生成序列的一致性与语义连贯性)量身定制的防御策略。
- 在两种核心NLG任务——神经机器翻译(NMT)和对话生成——上对攻击与防御性能进行基准测试。
- 提高对NLG系统中后门风险的认识,并激发未来在生成模型攻击与防御机制方面的研究。
提出的方法
- 提出一种基于后向概率的防御方法,通过计算 P(x|y) —— 即在给定目标输出下生成源输入的可能性 —— 来检测后门触发器。
- 将后向概率用作诊断信号:若 P(x|y) 显著低于预期,则将输入标记为可能被污染。
- 设计一种基于触发词的防御机制,通过监控目标输出中的语义变化来检测由后门触发器引起的异常。
- 引入一种基于重述的防御方法,将输入翻译为另一种语言后再翻译回来,利用语言一致性检测被污染的输入。
- 在NMT(一对一映射)和对话生成(一对多映射)任务上评估防御方法,以评估其在NLG任务中的泛化能力。
- 在训练过程中使用束搜索(beam search)和带标签平滑的交叉熵损失,以确保生成质量的同时保持对后门输入的鲁棒性。
实验结果
研究问题
- RQ1最先进的NLG模型(如用于机器翻译和对话生成的模型)在后门攻击下有多脆弱?
- RQ2NLG任务与自然语言理解(NLU)任务在后门攻击与防御策略上存在哪些关键差异?
- RQ3一种基于后向概率(P(x|y))的防御机制是否能有效检测并缓解多种NLG任务中的后门攻击?
- RQ4对话生成中的一对多特性如何影响后门防御方法的性能,相较于机器翻译等一对一任务?
- RQ5基于目标输出语义变化或输入重述的防御方法,在检测细微的非触发词型后门攻击(如同义词替换、无触发器攻击)方面能有多大的有效性?
主要发现
- 后门攻击在保持干净数据上高性能的同时,能以高成功率操纵NLG模型,表明存在显著的安全风险。
- 基于后向概率的防御方法(P(x|y))在所有攻击类型和任务中均优于其他所有方法,包括具有一对多映射的对话生成任务。
- 仅依赖源端分析的防御方法(如 ONION、paraphrase(src))对非触发词型攻击(如同义词替换、无触发器攻击)无效。
- 基于目标端语义变化的防御方法(如 Trigger(tgt)、paraphrase(tgt))在NMT中表现良好,但由于一对多问题在对话任务中性能下降。
- 后向概率方法对所有攻击类型(包括插入攻击、句法攻击、同义词攻击和无触发器攻击)均具有鲁棒性,因其在序列建模中具有通用性。
- 所提出的防御方法无需微调模型或依赖辅助模型,即可实现有效缓解,具有实际部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。