[论文解读] Defense of Word-level Adversarial Attacks via Random Substitution Encoding
本文提出随机替换编码(RSE),一种将动态随机同义词替换集成到文本分类模型训练过程中的防御框架,以增强对词级别对抗攻击的鲁棒性。通过在训练和推理过程中对输入进行随机选择的同义词编码,RSE 显著降低了攻击成功率,并在多种攻击模型下保持了高准确率,其鲁棒性和泛化能力优于先前的 SOTA 方法如同义词编码方法(SEM)。
The adversarial attacks against deep neural networks on computer vision tasks have spawned many new technologies that help protect models from avoiding false predictions. Recently, word-level adversarial attacks on deep models of Natural Language Processing (NLP) tasks have also demonstrated strong power, e.g., fooling a sentiment classification neural network to make wrong decisions. Unfortunately, few previous literatures have discussed the defense of such word-level synonym substitution based attacks since they are hard to be perceived and detected. In this paper, we shed light on this problem and propose a novel defense framework called Random Substitution Encoding (RSE), which introduces a random substitution encoder into the training process of original neural networks. Extensive experiments on text classification tasks demonstrate the effectiveness of our framework on defense of word-level adversarial attacks, under various base and attack models.
研究动机与目标
- 为解决 NLP 中针对词级别对抗攻击(特别是基于同义词替换且保持语义一致性的攻击)缺乏有效防御的问题。
- 克服现有防御方法(如同义词编码方法 SEM)的局限性,后者受限于固定的同义词映射且对未见过的对抗样本泛化能力差。
- 开发一种动态、可训练的防御机制,在无需事先了解攻击模式的情况下提升模型鲁棒性。
- 在多种文本分类任务、基础模型和攻击方法上评估所提防御的有效性。
- 证明在训练过程中引入同义词替换的随机化可提升模型对对抗扰动的泛化能力和鲁棒性。
提出的方法
- 提出一种随机替换编码器(RSE),在训练和推理过程中动态地将输入序列中的词语替换为随机选择的同义词。
- 在模型训练期间应用随机同义词替换算法,生成多样化的、带标签的邻域样本以实现鲁棒学习。
- 将 RSE 模块嵌入输入层与嵌入层之间,作为可训练的自适应防御层。
- 使用 RSE 处理的数据训练深度神经网络(如 Word-CNN、LSTM、Bi-LSTM),以提升对对抗输入的泛化能力。
- 将替换率作为评估攻击成本的指标,衡量成功攻击所需的词语替换数量。
- 采用两阶段评估:第一阶段评估模型在对抗攻击前后的准确率;第二阶段比较不同防御方法的攻击成功率和替换率。
实验结果
研究问题
- RQ1在训练过程中采用动态随机同义词替换机制,是否能提升模型对词级别对抗攻击的鲁棒性?
- RQ2与静态同义词编码方法(如 SEM)相比,RSE 在防御效果和泛化能力方面表现如何?
- RQ3RSE 在多大程度上降低了攻击成功率,并提高了攻击者所需的替换率?
- RQ4RSE 是否在保持良性输入下高性能的同时,显著提升了对抗条件下的鲁棒性?
- RQ5RSE 在不同基础模型(如 LSTM、Bi-LSTM、Word-CNN)和数据集(如 IMDB、AG’s News、Yahoo! Answers)上的表现如何?
主要发现
- 在 PWWS 攻击下,RSE 在 LSTM 上的平均攻击后准确率为 82.2%,在 Bi-LSTM 上为 88.3%,在 Word-CNN 上为 89.9%,显著优于 SEM。
- RSE 的平均准确率变化(攻击下的下降幅度)仅为 5–7.5%,而 SEM 为 10–21.1%,表明其具有更强的鲁棒性。
- 在大多数设置中,RSE 将攻击成功率降低了 50% 或以上,最低攻击成功率记录为 5.17%(在 Yahoo! Answers 上使用 Word-CNN 时)。
- 在大多数情况下,RSE 的替换率超过 20%,显著高于基线(NT)和对抗训练(AT),表明攻击成本显著增加。
- 在 AG’s News 数据集上使用 Word-CNN 时,RSE 将准确率下降幅度从 SEM 的 21.1% 降低至 7.5%,表明其泛化能力更强。
- RSE 在干净输入上保持了高精度,仅造成轻微的准确率下降(如在 IMDB 上使用 LSTM 时下降 4.8%),表明对良性性能影响极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。