[论文解读] Contextualized Perturbation for Textual Adversarial Attack
CLARE 是一种上下文感知的对抗性样本生成模型,采用掩码-填充方法,基于预训练掩码语言模型引入三种上下文感知扰动——替换(Replace)、插入(Insert)和合并(Merge)。与基线方法相比,它能生成更流畅、语法正确且语义相似的对抗性文本,攻击成功率更高,修改次数更少。
Adversarial examples expose the vulnerabilities of natural language processing (NLP) models, and can be used to evaluate and improve their robustness. Existing techniques of generating such examples are typically driven by local heuristic rules that are agnostic to the context, often resulting in unnatural and ungrammatical outputs. This paper presents CLARE, a ContextuaLized AdversaRial Example generation model that produces fluent and grammatical outputs through a mask-then-infill procedure. CLARE builds on a pre-trained masked language model and modifies the inputs in a context-aware manner. We propose three contextualized perturbations, Replace, Insert and Merge, allowing for generating outputs of varied lengths. With a richer range of available strategies, CLARE is able to attack a victim model more efficiently with fewer edits. Extensive experiments and human evaluation demonstrate that CLARE outperforms the baselines in terms of attack success rate, textual similarity, fluency and grammaticality.
研究动机与目标
- 解决现有启发式、上下文无关方法在生成 NLP 模型对抗性文本时的局限性。
- 通过利用预训练语言模型中的上下文知识,提升对抗性样本的流畅性、语法正确性和语义相似性。
- 实现可变输出长度的灵活扰动,克服基于 token 替换方法的固定长度限制。
- 设计一种高效的黑盒攻击策略,在最小化输入修改的同时最大化模型规避能力。
- 证明 CLARE 生成的对抗性样本可通过对抗性训练提升下游 NLP 模型的鲁棒性,尤其在数据稀缺条件下表现更优。
提出的方法
- CLARE 采用掩码-填充流程:对输入中的特定位置进行掩码,并使用预训练掩码语言模型(如 RoBERTa)进行填充。
- 引入三种上下文感知扰动操作:替换(替换一个 token)、插入(添加一个新 token)和合并(将一个二元组合并为单个 token)。
- 基于攻击效果和与原始输入的相似性对每种扰动进行评分和排序,实现迭代优化。
- 模型在黑盒设置下运行,仅依赖受害模型的预测结果,无需访问其内部参数。
- 扰动可应用于输入序列的任意位置,支持灵活且有针对性的修改。
- 通过句子嵌入和余弦相似度阈值保持文本相似性,确保生成样本与原始输入在人类感知上高度相似。
实验结果
研究问题
- RQ1与启发式、上下文无关的方法相比,上下文感知扰动能否提升对抗性文本的流畅性和语法正确性?
- RQ2CLARE 在保持高攻击成功率的前提下,能在多大程度上生成长度可变的对抗性样本?
- RQ3在攻击成功率、文本相似性、流畅性和语法正确性方面,CLARE 与最先进基线方法相比表现如何?
- RQ4CLARE 生成的对抗性样本能否提升下游 NLP 模型的鲁棒性,尤其在训练数据有限的情况下?
- RQ5使用预训练掩码语言模型是否能生成更自然、语义更连贯的对抗性样本?
主要发现
- 在文本分类、自然语言推理和句子释义任务中,CLARE 的攻击成功率均显著高于基线方法。
- 人工评估证实,CLARE 生成的样本在流畅性和语法正确性方面显著优于基线方法。
- 与同义词替换和启发式方法相比,CLARE 在句子嵌入余弦相似度上保持了更高的原始输入相似性。
- CLARE 实现成功攻击所需的修改次数更少,表明其扰动效率更高。
- 使用 CLARE 生成的对抗性样本进行对抗性训练,可显著提升微调后 BERT 模型的鲁棒性,尤其在低数据场景下效果更明显。
- 替换、插入和合并三种扰动的结合,实现了灵活且上下文感知的修改,既保持了语义一致性,又有效规避了检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。