[论文解读] Effective and Imperceptible Adversarial Textual Attack via Multi-objectivization
本文提出 HydraText,一种多目标进化算法,将对抗性文本攻击建模为兼顾攻击成功率与不可察觉性的双目标优化问题。通过将不可察觉性作为主要优化目标,HydraText 生成的对抗性样本更具自然性、更接近人类书写文本,在基于分数和基于决策的设置下均保持了具有竞争力的攻击成功率,且在流畅性和隐蔽性方面优于先前方法。
The field of adversarial textual attack has significantly grown over the last few years, where the commonly considered objective is to craft adversarial examples (AEs) that can successfully fool the target model. However, the imperceptibility of attacks, which is also essential for practical attackers, is often left out by previous studies. In consequence, the crafted AEs tend to have obvious structural and semantic differences from the original human-written text, making them easily perceptible. In this work, we advocate leveraging multi-objectivization to address such issue. Specifically, we reformulate the problem of crafting AEs as a multi-objective optimization problem, where the attack imperceptibility is considered as an auxiliary objective. Then, we propose a simple yet effective evolutionary algorithm, dubbed HydraText, to solve this problem. To the best of our knowledge, HydraText is currently the only approach that can be effectively applied to both score-based and decision-based attack settings. Exhaustive experiments involving 44237 instances demonstrate that HydraText consistently achieves competitive attack success rates and better attack imperceptibility than the recently proposed attack approaches. A human evaluation study also shows that the AEs crafted by HydraText are more indistinguishable from human-written text. Finally, these AEs exhibit good transferability and can bring notable robustness improvement to the target model by adversarial training.
研究动机与目标
- 解决现有对抗性文本攻击方法中缺乏不可察觉性的问题,这些方法常产生不自然或语法错误的扰动。
- 将对抗性攻击生成重新构建成多目标优化问题,以同时最大化攻击成功率与最小化可察觉性。
- 开发一个统一框架,适用于基于分数和基于决策的黑盒攻击场景,这些场景在实际部署中较为常见。
- 通过确保对抗性样本在语义和句法上与人类书写的文本保持接近,提升其真实性。
- 通过生成高质量、可迁移的扰动,使对抗性样本可用于鲁棒性评估与对抗性训练。
提出的方法
- 将对抗性攻击生成重新构建成双目标优化问题,目标为:最大化攻击成功率与最大化不可察觉性。
- 使用一种新颖的进化算法 HydraText,在保持语法正确性和语义连贯性的前提下,探索词替换的搜索空间。
- 将攻击成功率目标定义为模型对目标标签预测的置信度(基于分数);若成功预测目标标签,则给予无穷大奖励(基于决策)。
- 使用句子级相似度度量(如 BLEU、BERTScore)定义不可察觉性目标,以确保对抗性样本在语义和结构上与原始文本保持接近。
- 采用非支配排序机制,维护在两个目标上均表现优异的多样化高质量解集,优先选择既有效又自然的解。
- 通过相应调整目标函数,同时支持基于分数和基于决策的设置,无需依赖模型梯度,从而实现更广泛的应用。
实验结果
研究问题
- RQ1多目标化能否有效平衡对抗性文本攻击中的攻击成功率与不可察觉性?
- RQ2在不同 NLP 模型上,HydraText 与现有最先进方法相比,在攻击成功率和自然性方面表现如何?
- RQ3HydraText 能在多大程度上生成在人类评估中与人类书写的文本难以区分的对抗性样本?
- RQ4HydraText 在基于分数和基于决策的攻击设置下是否均保持强大性能?
- RQ5由 HydraText 生成的对抗性样本是否能通过对抗性训练有效提升目标模型的鲁棒性?
主要发现
- 在基于分数的设置下,HydraText 实现了具有竞争力的攻击成功率——在 BERT 上为 73.90%,在 Infersent 上为 74.66%,在 ESIM 上为 70.93%,同时在不可察觉性方面显著优于基线方法。
- 在基于决策的设置下,HydraText 在 BERT 上达到 82.57% 的成功率,在 Infersent 上为 84.27%,在 ESIM 上为 79.12%,且相似度得分(0.571、0.610、0.601)高于所有基线方法。
- 人类评估确认,与基线相比,HydraText 生成的对抗性样本更具自然性,且更难与人类书写的文本区分。
- 由 HydraText 构造的对抗性样本表现出强大的可迁移性,并在用于对抗性训练时有效提升了模型的鲁棒性。
- 与部分基线相比,HydraText 显著减少了每次攻击所需的查询次数(例如,在基于分数的设置下 BERT 上为 244.4),表明其具备更高的查询效率。
- 在定向攻击场景中,HydraText 在保持高成功率(例如在 BERT 上为 82.57%)的同时,实现了更优的相似度得分,证明其在受限攻击场景下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。