Skip to main content
QUICK REVIEW

[论文解读] Defending Pre-trained Language Models from Adversarial Word Substitutions Without Performance Sacrifice

Rongzhou Bao, Jiayi Wang|arXiv (Cornell University)|May 30, 2021
Adversarial Robustness in Machine Learning参考文献 23被引用 4
一句话总结

本文提出 ADFAR,一种紧凑的防御框架,结合频率感知随机化与辅助异常检测器,以抵御预训练语言模型遭受的对抗性词替换攻击,且不损失性能。通过检测对抗性输入并在其上仅应用有针对性的随机化,ADFAR 在保持原始非对抗样本准确率的同时,实现了更优的鲁棒性与推理速度。

ABSTRACT

Pre-trained contextualized language models (PrLMs) have led to strong performance gains in downstream natural language understanding tasks. However, PrLMs can still be easily fooled by adversarial word substitution, which is one of the most challenging textual adversarial attack methods. Existing defence approaches suffer from notable performance loss and complexities. Thus, this paper presents a compact and performance-preserved framework, Anomaly Detection with Frequency-Aware Randomization (ADFAR). In detail, we design an auxiliary anomaly detection classifier and adopt a multi-task learning procedure, by which PrLMs are able to distinguish adversarial input samples. Then, in order to defend adversarial word substitution, a frequency-aware randomization process is applied to those recognized adversarial input samples. Empirical results show that ADFAR significantly outperforms those newly proposed defense methods over various tasks with much higher inference speed. Remarkably, ADFAR does not impair the overall performance of PrLMs. The code is available at https://github.com/LilyNLP/ADFAR

研究动机与目标

  • 解决预训练语言模型(PrLMs)在对抗性词替换攻击下的脆弱性,此类攻击能保持语法正确性与语义连贯性。
  • 开发一种防御机制,确保在非对抗性输入上保持高预测准确率,避免现有防御方法常见的性能下降问题。
  • 设计一种高效、低复杂度的防御框架,适用于实际部署,计算开销极小。
  • 在无需大量微调或模型修改的前提下,实现对启发式词替换攻击的鲁棒性。

提出的方法

  • 通过多任务学习,与主 PrLM 一同训练一个辅助异常检测分类器,以识别对抗性输入样本。
  • 仅对检测到的对抗性输入在推理过程中应用频率感知随机化,将词语替换为更频繁的同义词,以减轻对抗影响。
  • 频率感知策略优先将罕见词替换为更频繁的同义词,利用预训练语言模型对频繁词更具鲁棒性的观察。
  • 随机化仅选择性地应用于对抗性样本,保留原始预测流程以避免对干净输入造成性能损失。
  • 同义词集合构建采用频率阈值过滤,确保仅考虑语义与句法上合理的替换。
  • 训练过程结合频率感知随机化,控制替换比例,以增强训练数据并提升鲁棒性。

实验结果

研究问题

  • RQ1防御框架是否能在不降低干净输入性能的前提下检测对抗性词替换?
  • RQ2频率感知随机化在缓解对抗性词替换攻击方面效果如何?
  • RQ3在词替换攻击背景下,辅助异常检测器是否能可靠地区分对抗性输入与干净输入?
  • RQ4在鲁棒性与推理效率之间,替换比例与同义词集合大小的最优平衡是什么?
  • RQ5异常检测与频率感知随机化的结合是否在鲁棒性与推理速度上均优于现有防御方法?

主要发现

  • ADFAR 在多个 NLP 任务中,对抗性准确率显著高于 Ye 等人(2020)和 Zhou 等人(2019)提出的先前防御方法。
  • 该方法在非对抗性输入上保持了原始预测准确率,证实无性能损失。
  • 推理阶段替换比例为 30%、训练阶段为 25% 时达到最高对抗性准确率,表明鲁棒性与保真度之间的最优权衡。
  • 频率感知随机化对防御贡献最大,当罕见词被更频繁的同义词替换时,性能达到峰值。
  • 辅助异常检测器能有效识别当前启发式词替换策略生成的对抗性样本,从而实现随机化的精准应用。
  • ADFAR 的推理速度显著高于现有防御方法,适用于实时部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。