[论文解读] Universal Adversarial Attacks with Natural Triggers for Text Classification
本文提出自然通用触发搜索(NUTS),一种使用自然流畅触发词而非无意义词序列来生成文本分类通用对抗攻击的方法。通过利用对抗性正则化自编码器(ARAE)与带l₂正则化的梯度优化,NUTS生成的触发词在保持高度自然性的同时,实现了较高的攻击成功率(例如在SST数据集上达到19.96%的准确率)。人类评估者中,77.78%认为其触发词比基线方法更自然,44.27%认为其为自然生成,使其比以往工作更难被检测。
Recent work has demonstrated the vulnerability of modern text classifiers to universal adversarial attacks, which are input-agnostic sequences of words added to text processed by classifiers. Despite being successful, the word sequences produced in such attacks are often ungrammatical and can be easily distinguished from natural text. We develop adversarial attacks that appear closer to natural English phrases and yet confuse classification systems when added to benign inputs. We leverage an adversarially regularized autoencoder (ARAE) to generate triggers and propose a gradient-based search that aims to maximize the downstream classifier's prediction loss. Our attacks effectively reduce model accuracy on classification tasks while being less identifiable than prior models as per automatic detection metrics and human-subject studies. Our aim is to demonstrate that adversarial attacks can be made harder to detect than previously thought and to enable the development of appropriate defenses.
研究动机与目标
- 解决文本分类器在面对使用不自然、易被检测的触发词的通用对抗攻击时的脆弱性。
- 开发一种生成对抗性触发词的方法,使其与自然语言无异,从而逃避自动化工具与人类观察者的检测。
- 证明对抗攻击可显著比以往认为的更隐蔽,从而推动更强防御机制的发展。
- 实现跨不同模型与数据集的可迁移攻击,减少对白盒访问的依赖。
提出的方法
- 该方法使用对抗性正则化自编码器(ARAE)从连续噪声向量生成自然文本,确保语义连贯性与语言流畅性。
- 在噪声向量空间中进行基于梯度的搜索,以优化使目标分类器预测损失最大的触发词。
- 应用带l₂范数正则化的投影梯度下降法,防止分布外的噪声向量出现,从而保持自然性。
- 直接将触发词作为完整短语生成,而非单个词提示,从而提升语义质量与抗检测能力。
- 攻击通过将单一、与输入无关的触发词拼接在良性输入开头来实施。
- 通过在一种模型上生成触发词并在其他模型上测试来评估可迁移性,涵盖不同架构(LSTM、BERT)与数据集(SST、IMDB)。
实验结果
研究问题
- RQ1是否可以生成既高效又与自然语言无异的对抗性触发词?
- RQ2对抗性触发词的自然性在人类与自动化检测中分别产生何种影响?
- RQ3攻击在不同模型架构与数据集间的可迁移性达到何种程度?
- RQ4在潜在空间上基于梯度的优化能否生成高质量、自然的触发词,同时保持强大的攻击性能?
主要发现
- NUTS生成的触发词在斯坦福情感树库(SST)的负样本上实现了19.96%的测试准确率,证明了其强大的攻击成功率。
- 在成对比较中,77.78%的人类评估者认为NUTS触发词比基线攻击更自然,即使拼接在良性输入之后亦然。
- 44.27%的人类受试者认为NUTS攻击输入为自然生成,而基线攻击仅为22.84%。
- 当从LSTM源模型迁移至BERT模型时,攻击导致准确率下降14%至51%,表明其具有强大的跨架构可迁移性。
- 在IMDB数据集上,迁移攻击使目标LSTM模型的准确率下降18%至34%,证实了其跨数据集的可迁移性。
- 在三项自然性指标上,NUTS触发词优于基线:平均词频、GPT-2语言模型损失与语法检查器错误率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。