Skip to main content
QUICK REVIEW

[论文解读] Certified Robustness to Adversarial Word Substitutions

Robin Jia, Aditi Raghunathan|arXiv (Cornell University)|Sep 3, 2019
Adversarial Robustness in Machine Learning参考文献 26被引用 16
一句话总结

该论文首次通过区间边界传播(IBP)实现了对自然语言处理(NLP)中对抗性词替换的可证明鲁棒性模型。通过最小化所有词替换扰动下最坏情况损失的上界,该方法在IMDB和SNLI数据集上实现了75%的对抗性准确率,显著优于标准训练(8%)和数据增强(35%)。

ABSTRACT

State-of-the-art NLP models can often be fooled by adversaries that apply seemingly innocuous label-preserving transformations (e.g., paraphrasing) to input text. The number of possible transformations scales exponentially with text length, so data augmentation cannot cover all transformations of an input. This paper considers one exponentially large family of label-preserving transformations, in which every word in the input can be replaced with a similar word. We train the first models that are provably robust to all word substitutions in this family. Our training procedure uses Interval Bound Propagation (IBP) to minimize an upper bound on the worst-case loss that any combination of word substitutions can induce. To evaluate models' robustness to these transformations, we measure accuracy on adversarially chosen word substitutions applied to test examples. Our IBP-trained models attain $75\%$ adversarial accuracy on both sentiment analysis on IMDB and natural language inference on SNLI. In comparison, on IMDB, models trained normally and ones trained with data augmentation achieve adversarial accuracy of only $8\%$ and $35\%$, respectively.

研究动机与目标

  • 解决NLP模型对标签保持不变的词替换的脆弱性问题,此类替换虽仅引起微小语义变化,却可能显著降低性能。
  • 克服所有可能词替换扰动的指数级复杂性,使穷举搜索或数据增强方法不可行。
  • 开发一种训练方法,确保对所有此类替换的鲁棒性,而非依赖启发式攻击或有限的数据增强。
  • 将区间边界传播(IBP)扩展至NLP中的离散非连续层(如LSTM和注意力机制),以计算可证明的鲁棒性边界。
  • 证明通过可证明鲁棒性训练,可在真实世界NLP任务中实现高对抗性准确率,即使在最坏情况扰动下亦然。

提出的方法

  • 使用区间边界传播(IBP)计算由任意词替换组合引起的最坏情况损失的可处理上界。
  • 推导NLP中离散操作(如乘法和Softmax层)的新区间边界公式,以将IBP扩展至LSTM和自注意力机制。
  • 将IBP适配于处理离散扰动集(词替换)而非连续扰动,这对NLP应用至关重要。
  • 通过最小化最坏情况损失的IBP上界来训练模型,从而在不依赖基于梯度的对抗性训练的前提下实现可证明鲁棒的一般化。
  • 将该方法应用于多种架构(词袋、CNN、LSTM、注意力)在情感分析(IMDB)和自然语言蕴涵(SNLI)任务中的应用。

实验结果

研究问题

  • RQ1我们能否为NLP中所有可能的词替换扰动提供形式化、可证明的鲁棒性保证?
  • RQ2是否可行通过可处理的优化方法训练出对指数级庞大的标签保持型词替换集合具有鲁棒性的模型?
  • RQ3与标准训练和数据增强相比,通过IBP实现的可证明鲁棒性训练在对抗性准确率方面表现如何?
  • RQ4IBP能否有效扩展至NLP中的离散、不可微分层(如LSTM和注意力机制)?
  • RQ5使用这种可证明训练方法,在IMDB和SNLI等真实世界NLP基准上可实现多高的鲁棒性?

主要发现

  • 所提出的基于IBP的可证明鲁棒性训练在IMDB情感分析数据集上实现了75%的对抗性准确率,而标准训练仅为8%。
  • 在SNLI自然语言蕴涵基准上,该方法达到了75%的对抗性准确率,显著优于标准训练(41%)和数据增强(71%)。
  • 数据增强在IMDB上将鲁棒性提升至35%,在SNLI上达到71%,但仍无法达到IBP训练提供的可证明鲁棒性水平。
  • 该方法成功将IBP扩展至离散NLP层,包括LSTM和注意力机制,使这些架构的鲁棒性认证成为可能。
  • 所训练模型对定义集合内的所有词替换均具有可证明鲁棒性,其保证源自IBP对最坏情况损失的上界。
  • 该方法表明,即使在大规模离散扰动空间下,NLP中的可证明鲁棒性也是可实现的,标志着迈向可信NLP系统的重要一步。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。