Skip to main content
QUICK REVIEW

[论文解读] Discrete Attacks and Submodular Optimization with Applications to Text Classification.

Qi Lei, Lingfei Wu|arXiv (Cornell University)|Dec 1, 2018
Adversarial Robustness in Machine Learning参考文献 14被引用 16
一句话总结

本文将文本对抗攻击形式化为在离散集合上的子模优化问题,通过在简化假设下利用攻击目标的子模性,借助贪心搜索实现1−1/e的近似保证。通过整合分类器梯度以指导搜索,并采用联合句子-词语改写技术,该方法在三个文本分类任务中均实现了比基线方法更高的攻击成功率和更高的语义保真度。

ABSTRACT

Adversarial examples are carefully constructed modifications to an input that completely change the output of a classifier but are imperceptible to humans. Despite these successful attacks for continuous data (such as image and audio samples), generating adversarial examples for discrete structures such as text has proven significantly more challenging. In this paper we formulate the attacks with discrete input on a set function as an optimization task. We prove that this set function is submodular for some popular neural network text classifiers under simplifying assumption. This finding guarantees a $1-1/e$ approximation factor for attacks that use the greedy algorithm. Meanwhile, we show how to use the gradient of the attacked classifier to guide the greedy search. Empirical studies with our proposed optimization scheme show significantly improved attack ability and efficiency, on three different text classification tasks over various baselines. We also use a joint sentence and word paraphrasing technique to maintain the original semantics and syntax of the text. This is validated by a human subject evaluation in subjective metrics on the quality and semantic coherence of our generated adversarial text.

研究动机与目标

  • 为解决生成有效对抗样本以应对离散文本输入的挑战,此类挑战相较于图像等连续数据更困难。
  • 将对抗攻击过程建模为集合函数上的子模优化问题,以确保理论上的近似保证。
  • 通过结合贪心搜索与目标分类器的梯度信息,提升攻击效率与成功率。
  • 通过联合句子与词语改写技术,保持对抗文本的语义连贯性与句法质量。
  • 通过人工评估验证生成的对抗样本在语义连贯性与流畅性方面的质量。

提出的方法

  • 将离散文本上的对抗攻击形式化为表示分类器输出变化的集合函数上的优化问题。
  • 在主流神经网络文本分类器的简化假设下,证明该集合函数具有子模性,从而通过贪心搜索实现1−1/e的近似保证。
  • 整合分类器梯度以指导词或句子修改的贪心选择,提升攻击有效性。
  • 采用联合句子与词语改写技术,在扰动过程中保持输入文本的原始语义与句法结构。
  • 采用两阶段流程:首先通过贪心优化识别扰动;其次应用改写以保持流畅性与连贯性。
  • 在三个不同的文本分类任务上应用该方法,以评估攻击成功率、效率与语义质量。

实验结果

研究问题

  • RQ1能否将离散文本输入的对抗攻击形式化为子模优化问题,以确保理论性能边界?
  • RQ2将梯度引导与贪心搜索结合,相较于基线方法,如何提升攻击成功率?
  • RQ3联合句子与词语改写在多大程度上能保持对抗样本的语义连贯性与句法结构?
  • RQ4所提方法在多样化文本分类任务中的实际攻击成功率与效率如何?
  • RQ5人工评估者如何评价生成的对抗文本的质量与语义连贯性?

主要发现

  • 所提方法在三个文本分类任务中均显著优于现有基线方法,实现了更高的攻击成功率。
  • 子模形式化为攻击性能提供了理论上的1−1/e近似保证,奠定了坚实的优化基础。
  • 梯度引导的贪心搜索显著提升了攻击效率与有效性,优于非梯度驱动的贪心方法。
  • 人工评估确认,生成的对抗文本保持了高度的语义连贯性与流畅性,质量下降可忽略。
  • 联合句子与词语改写技术在扰动过程中成功保持了原始文本的语义与句法结构。
  • 实证结果表明,该方法兼具高效性与有效性,适用于NLP系统中的实际对抗测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。