[论文解读] Certified Robustness Against Natural Language Attacks by Causal Intervention
本文提出了一种名为语义平滑因果干预(CISS)的新框架,通过在语义空间中平滑来建模因果效应 $p(y|do(x))$,实现了对自然语言攻击的认证鲁棒性。在综合攻击下,CISS 在 IMDB 数据集上实现了 76.5% 的认证鲁棒准确率,在 YELP 数据集上实现了 80.7% 的经验鲁棒性,优于当前最先进方法。
Deep learning models have achieved great success in many fields, yet they are vulnerable to adversarial examples. This paper follows a causal perspective to look into the adversarial vulnerability and proposes Causal Intervention by Semantic Smoothing (CISS), a novel framework towards robustness against natural language attacks. Instead of merely fitting observational data, CISS learns causal effects p(y|do(x)) by smoothing in the latent semantic space to make robust predictions, which scales to deep architectures and avoids tedious construction of noise customized for specific attacks. CISS is provably robust against word substitution attacks, as well as empirically robust even when perturbations are strengthened by unknown attack algorithms. For example, on YELP, CISS surpasses the runner-up by 6.7% in terms of certified robustness against word substitutions, and achieves 79.4% empirical robustness when syntactic attacks are integrated.
研究动机与目标
- 为解决深度 NLP 模型对对抗攻击(尤其是词替换和句法扰动)的脆弱性问题。
- 通过因果视角理解对抗鲁棒性,将混淆变量识别为模型脆弱性的根本原因。
- 开发一种可扩展的认证鲁棒性框架,避免依赖攻击特定的噪声工程。
- 在已知和未知的对抗攻击下,同时实现可证明(认证)和经验鲁棒性。
提出的方法
- CISS 通过在潜在语义空间中消除混淆因子的影响,建模干预分布 $p(y|do(x))$,从而在 NLP 中实现因果推理。
- 它在预训练模型(如 BERT)的潜在空间中应用语义平滑,以近似 $p(y|do(x))$,避免依赖输入空间的噪声分布。
- 该方法基于随机平滑,其中平滑分类器估计 $p(y|do(x)) = \int p(y|x,n)p(n)\,dn$,从因果视角解释其鲁棒性。
- CISS 在潜在表示上采用可微分的平滑策略,支持端到端训练,并可扩展至 Transformer 模型。
- 由于其因果不变性,该框架即使在未知攻击算法增强扰动时也保持鲁棒。
- 超参数如平滑幅度 $\gamma$ 和潜在噪声幅度 $m$ 经调优以平衡鲁棒性与准确率,且对 $\sigma$ 敏感度极低。
实验结果
研究问题
- RQ1NLP 模型的对抗脆弱性是否可归因于可操控混淆因子(如风格或术语)引发的虚假相关性?
- RQ2随机平滑是否可被解释为估计因果效应 $p(y|do(x))$,并为此类认证鲁棒性提供理论基础?
- RQ3语义空间平滑能否生成可证明鲁棒的 NLP 模型,并可扩展至如 Transformer 等深度架构?
- RQ4在潜在空间中建模因果效应是否能带来对已见和未见对抗攻击(包括句法和编辑类扰动)的鲁棒性?
主要发现
- 在 IMDB 数据集上,CISS 在词替换攻击下实现了 76.5% 的认证鲁棒准确率,领先第二名 7.2 个百分点。
- 在 YELP 数据集上,CISS 在综合句法攻击下达到 80.7% 的经验鲁棒性,领先第二名 6.8 个百分点。
- CISS 在多种超参数设置下均表现出强认证鲁棒性:在 YELP 上,当 $\gamma=4$ 且 $m=1$ 时,认证准确率达 75.25%;在 IMDB 上,$\sigma$ 从 0.5 到 4 的范围内,认证鲁棒性均保持在 90% 以上。
- CISS 的性能对高斯噪声标准差 $\sigma$ 的敏感度极低,表明其对超参数调优具有鲁棒性——这与先前的随机平滑方法不同。
- 在综合攻击下,CISS 在 YELP 上实现了 83.1% 的经验鲁棒性,领先第二名 7.8 个百分点。
- 消融研究证实,潜在语义空间中的平滑至关重要:若在输入空间中应用或缺乏因果干预,性能会显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。