Skip to main content
QUICK REVIEW

[论文解读] Efficient Combinatorial Optimization for Word-level Adversarial Textual Attack

Shengcai Liu, Ning Lü|arXiv (Cornell University)|Sep 6, 2021
Adversarial Robustness in Machine Learning参考文献 49被引用 5
一句话总结

该论文提出了一种用于词级对抗文本攻击的局部搜索算法(LS),将优化问题建模为具有划分拟阵约束的集合最大化问题。LS在最多减少10倍查询次数的同时实现了最先进性能,攻击成功率更高,且在对抗样本质量、迁移能力以及对抗训练中的鲁棒性增益方面均有提升。

ABSTRACT

Over the past few years, various word-level textual attack approaches have been proposed to reveal the vulnerability of deep neural networks used in natural language processing. Typically, these approaches involve an important optimization step to determine which substitute to be used for each word in the original input. However, current research on this step is still rather limited, from the perspectives of both problem-understanding and problem-solving. In this paper, we address these issues by uncovering the theoretical properties of the problem and proposing an efficient local search algorithm (LS) to solve it. We establish the first provable approximation guarantee on solving the problem in general cases.Extensive experiments involving 5 NLP tasks, 8 datasets and 26 NLP models show that LS can largely reduce the number of queries usually by an order of magnitude to achieve high attack success rates. Further experiments show that the adversarial examples crafted by LS usually have higher quality, exhibit better transferability, and can bring more robustness improvement to victim models by adversarial training.

研究动机与目标

  • 为解决词级对抗攻击中组合优化步骤缺乏理论理解与高效求解方法的问题。
  • 开发一种查询高效的优化算法,平衡高攻击成功率与低查询成本。
  • 首次在一般情况下为词级对抗攻击优化建立可证明的近似保证。
  • 实现与现有词替换方法及未来攻击框架的即插即用集成。
  • 提升对抗样本在训练中的质量、迁移能力以及鲁棒性增益。

提出的方法

  • 将词级对抗攻击优化建模为具有划分拟阵约束的集合最大化问题,该问题已被证明为NP难。
  • 提出一种局部搜索算法(LS),通过考虑三种类型的扰动(同义词、语义元基础、上下文感知)迭代选择替换。
  • 采用基于边际收益递减的终止条件,以避免过多查询。
  • 引入性能近似界,为该问题类别提供首个通用理论保证。
  • 设计算法时独立于词替换方法,可即插即用集成任意现有替换技术。
  • 采用贪心选择策略,优先选择能带来最高即时攻击成功率提升的替换,同时保持语法正确性与自然性。

实验结果

研究问题

  • RQ1词级对抗优化问题的理论难度如何?我们能否建立性能保证?
  • RQ2我们能否设计一种查询高效的优化算法,在不依赖梯度信息的情况下实现高攻击成功率?
  • RQ3与现有方法相比,所提出的LS算法在查询效率、成功率及对抗样本质量方面表现如何?
  • RQ4LS生成的对抗样本在多大程度上能通过对抗训练提升模型鲁棒性?
  • RQ5LS能否在不同词替换方法和NLP模型上实现泛化?

主要发现

  • LS在5个NLP任务和26个模型上相比基线方法将模型查询次数减少了整整一个数量级,同时实现了更高的攻击成功率。
  • 由LS生成的对抗样本具有更高的语法正确性与自然性,从而产生更高质量的扰动。
  • LS生成的样本在不同模型和数据集间表现出更优的迁移能力,尤其在黑盒设置下表现突出。
  • 使用LS生成的对抗样本进行对抗训练,相比基线方法生成的样本,能带来更大的鲁棒性提升。
  • 即使在对抗训练后,该算法仍保持强劲性能,表明其相比基线方法对防御微调的敏感性更低。
  • LS的理论近似界首次为一般情况下的词级对抗优化提供了可证明的性能保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。