Skip to main content
QUICK REVIEW

[论文解读] Achieving Verified Robustness to Symbol Substitutions via Interval Bound Propagation

Po-Sen Huang, Robert Stanforth|arXiv (Cornell University)|Sep 3, 2019
Adversarial Robustness in Machine Learning参考文献 43被引用 18
一句话总结

本文提出一种基于区间边界传播(IBP)的神经文本分类器形式化验证方法,可保证对同义词替换和字符替换攻击的鲁棒性。通过将扰动建模为单纯形并采用改进的目标函数进行训练,该方法实现了常数时间验证下的高验证准确率,优于对抗训练在全面验证下的表现。

ABSTRACT

Neural networks are part of many contemporary NLP systems, yet their empirical successes come at the price of vulnerability to adversarial attacks. Previous work has used adversarial training and data augmentation to partially mitigate such brittleness, but these are unlikely to find worst-case adversaries due to the complexity of the search space arising from discrete text perturbations. In this work, we approach the problem from the opposite direction: to formally verify a system's robustness against a predefined class of adversarial attacks. We study text classification under synonym replacements or character flip perturbations. We propose modeling these input perturbations as a simplex and then using Interval Bound Propagation -- a formal model verification method. We modify the conventional log-likelihood training objective to train models that can be efficiently verified, which would otherwise come with exponential search complexity. The resulting models show only little difference in terms of nominal accuracy, but have much improved verified accuracy under perturbations and come with an efficiently computable formal guarantee on worst case adversaries.

研究动机与目标

  • 为文本分类模型提供针对符号替换攻击的形式化、可证明的鲁棒性保障。
  • 解决对抗训练在面对最坏情况对手时缺乏保障的局限性。
  • 开发一种可验证的训练目标,使基于区间边界传播(IBP)的高效、可扩展验证成为可能。
  • 研究扰动空间大小与词嵌入质量对验证边界的影响。
  • 证明在不牺牲名义准确率的前提下,可实现验证鲁棒性。

提出的方法

  • 将模型输入扰动(同义词或字符替换)建模为输入空间中的单纯形,表示所有可能的语义不变变化。
  • 应用区间边界传播(IBP)以计算在整个扰动单纯形上模型输出的紧致、高效边界。
  • 修改标准对数似然训练目标,以鼓励模型在IBP验证下更具可验证性,从而在推理过程中提升鲁棒性。
  • 使用对抗拟合词嵌入(counter-fitted word embeddings)以减小扰动单纯形的体积,从而获得更紧致的IBP边界并提升验证准确率。
  • 通过全面验证的基准测试与对抗训练和数据增强基线进行鲁棒性评估。
  • 利用轴对齐的边界框,将区间边界传播至每一层,实现在logit空间中的高效最坏情况分析。

实验结果

研究问题

  • RQ1通过IBP进行形式化验证能否为文本分类模型在同义词和字符替换攻击下提供可证明的鲁棒性保障?
  • RQ2扰动空间的大小如何影响基于IBP的验证和对抗训练的有效性?
  • RQ3对抗拟合词嵌入在多大程度上提升了IBP边界的紧致性与验证准确率?
  • RQ4在全面验证下,可验证训练是否比对抗训练带来更好的鲁棒性?
  • RQ5IBP验证的计算成本与不同扰动半径下的全面搜索相比如何?

主要发现

  • IBP训练的模型在SST-character数据集上δ=3时达到98.4%的验证准确率,显著优于对抗训练模型在全面验证下的表现。
  • IBP验证成本恒定且可忽略不计,而全面验证在SST-character数据集上δ=3时需高达140万次前向传播,难以在大规模场景中应用。
  • 使用对抗拟合嵌入可使IBP验证准确率在δ=1时最高提升33.2%,表明减小单纯形体积可提升边界紧致性。
  • 对抗训练无法泛化至最坏情况对手,其在全面验证下表现差,暴露出一种虚假的鲁棒性错觉。
  • 所有模型的名义测试准确率均保持基本不变(波动在1%以内),表明可验证性并未损害标准性能。
  • 该方法具有高效可扩展性:IBP验证比全面搜索快数个数量级,可实现鲁棒NLP系统的实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。