[论文解读] Learning to Discriminate Perturbations for Blocking Adversarial Attacks in Text Classification
本文提出 DISP,一种新颖的防御框架,可在不微调模型的情况下识别并恢复文本分类中的对抗性扰动。通过使用基于对比学习的扰动判别器和基于 k-NN 检索的嵌入估计器,DISP 恢复原始语义并阻断攻击,在 SST-2 和 IMDb 数据集上显著优于基线方法,且在不同数据集间展现出强大的可迁移性。
Adversarial attacks against machine learning models have threatened various real-world applications such as spam filtering and sentiment analysis. In this paper, we propose a novel framework, learning to DIScriminate Perturbations (DISP), to identify and adjust malicious perturbations, thereby blocking adversarial attacks for text classification models. To identify adversarial attacks, a perturbation discriminator validates how likely a token in the text is perturbed and provides a set of potential perturbations. For each potential perturbation, an embedding estimator learns to restore the embedding of the original word based on the context and a replacement token is chosen based on approximate kNN search. DISP can block adversarial attacks for any NLP model without modifying the model structure or training procedure. Extensive experiments on two benchmark datasets demonstrate that DISP significantly outperforms baseline methods in blocking adversarial attacks for text classification. In addition, in-depth analysis shows the robustness of DISP across different situations.
研究动机与目标
- 为解决在不修改模型架构或训练过程的前提下防御 NLP 模型对抗攻击的挑战。
- 开发一种防御机制,以识别在离散词元空间和大规模词汇表下难以察觉的、语义上合理的细微扰动。
- 利用上下文嵌入与高效的最近邻搜索恢复被扰动的词元,同时保持句子连贯性与预测准确性。
- 实现在无需在目标数据上微调的前提下,将防御能力迁移至不同文本语料与 NLP 任务。
- 为现有模型提供即插即用的解决方案,增强对各类攻击(包括词级与字符级篡改)的鲁棒性。
提出的方法
- 训练一个扰动判别器,利用对抗样本上的对比学习目标,将每个词元分类为被扰动或未被扰动。
- 嵌入估计器学习从上下文和候选替换词元中重建原始词嵌入,基于预训练语料库进行训练。
- 对每个识别出的被扰动词元,在预计算的词嵌入 HNSW 图中执行 k-NN 检索,以找到语义最相似的词。
- 该框架作为后处理模块运行,无需微调目标 NLP 模型,支持即插即用部署。
- 该方法利用上下文表示确保在词元恢复过程中保持语义一致性,最大限度减少性能下降。
- 系统在对抗样本上端到端训练,实现对不同攻击类型与数据集的泛化能力。
实验结果
研究问题
- RQ1是否存在一种防御机制,可在不修改目标模型架构或训练过程的前提下,检测并恢复文本中的对抗性扰动?
- RQ2所提出的框架在阻断各类对抗攻击(包括词替换、插入、删除及字符级替换)方面的有效性如何?
- RQ3扰动判别器与嵌入估计器在不同文本语料与 NLP 任务上的泛化能力有多强?
- RQ4当上下文信息稀疏或存在多个扰动时,该防御机制的性能会如何退化?
- RQ5该防御机制能否从一个数据集(如 IMDb)迁移到另一个数据集(如 SST-2)而无需重新训练?
主要发现
- 在 SST-2 数据集上,DISP 在交换攻击下达到 87.96% 的准确率,显著优于基线方法。
- 在 IMDb 数据集上,DISP 在删除攻击下仍保持 86.81% 的准确率,展现出对多种攻击类型的强鲁棒性。
- 在迁移防御设置中,DISP 在 IMDb 上训练后,其性能与在 SST-2 上微调的模型相当,表明具备强大的跨数据集泛化能力。
- 嵌入估计器在 SST-2 上取得 0.0442 的低 RMSE 分数,在 IMDb 上为 0.1030,表明对原始词嵌入的语义重建质量很高。
- 在 CoLA 的语言可接受性分类任务中,DISP 将对抗攻击下的性能下降从 BERT 的 0.1209 降低至 0.5502 的准确率,证明其在情感分析之外也具有效果。
- 案例研究证实,DISP 能成功将被扰动的词如 'orignal' 恢复为 'original','bet' 恢复为 'best',但在低上下文或多重扰动情况下性能有所下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。