[论文解读] Robust Textual Embedding against Word-level Adversarial Attacks
本文提出了一种名为快速三元组度量学习(FTML)的新方法,通过学习使同义词在嵌入空间中更接近、非同义词更远离的词嵌入,从而增强对词级对抗攻击的鲁棒性。FTML在多种模型(CNN、LSTM、BERT)上实现了最先进的鲁棒准确率,训练开销极低,显著提升了对PWWS和HLA等攻击的防御能力,同时保持了较高的干净准确率。
We attribute the vulnerability of natural language processing models to the fact that similar inputs are converted to dissimilar representations in the embedding space, leading to inconsistent outputs, and we propose a novel robust training method, termed Fast Triplet Metric Learning (FTML). Specifically, we argue that the original sample should have similar representation with its adversarial counterparts and distinguish its representation from other samples for better robustness. To this end, we adopt the triplet metric learning into the standard training to pull words closer to their positive samples (i.e., synonyms) and push away their negative samples (i.e., non-synonyms) in the embedding space. Extensive experiments demonstrate that FTML can significantly promote the model robustness against various advanced adversarial attacks while keeping competitive classification accuracy on original samples. Besides, our method is efficient as it only needs to adjust the embedding and introduces very little overhead on the standard training. Our work shows great potential of improving the textual robustness through robust word embedding.
研究动机与目标
- 为解决NLP模型在词级对抗攻击下的脆弱性问题,即同义词替换虽保持语义相似性却导致预测不一致。
- 识别出模型鲁棒性因嵌入空间中语义相似输入的表示不一致而被削弱。
- 提出一种通用且高效的方法,学习对同义词替换具有不变性的鲁棒词嵌入。
- 在不依赖昂贵的对抗训练或复杂认证防御机制的前提下,提升模型鲁棒性。
- 在标准NLP基准上,于多种架构(包括BERT)中展示FTML的有效性与高效性。
提出的方法
- FTML引入一种三元组损失,使词语在嵌入空间中更靠近其同义词(正样本),同时远离非同义词(负样本)。
- 该方法将此三元组损失整合到标准训练流程中,仅需对嵌入层进行微小调整,计算开销可忽略不计。
- 利用同义词词典为每个词定义正负样本,实现对词表示的针对性优化。
- 对于BERT,通过在微调过程中扩展词汇表以包含高频实际词汇,提升完整词语的嵌入表示质量。
- 采用标准交叉熵损失与三元组损失的加权组合,通过调节超参数α和β实现干净准确率与鲁棒准确率之间的权衡。
- 该方法在获得同义词词典后可推广至任意语言,具有广泛的适用性,不仅限于英语。
实验结果
研究问题
- RQ1通过同义词接近性学习更一致的词嵌入,能否提升模型对词级对抗攻击的鲁棒性?
- RQ2与标准对抗训练相比,所提出的三元组度量学习方法在鲁棒性与效率方面表现如何?
- RQ3在BERT词汇表中加入实际词汇对FTML性能有何影响?
- RQ4FTML性能对损失函数中超参数α和β的敏感度如何?
- RQ5FTML能否在多种模型与数据集上维持高干净准确率,同时显著提升鲁棒准确率?
主要发现
- 当BERT词汇表扩展至包含50,000个实际词汇时,FTML在IMDB数据集上对PWWS攻击的鲁棒准确率达到81.2%,而标准微调BERT仅为16.6%。
- FTML训练的BERT模型鲁棒性随词汇表规模增大而提升,当添加50,000个词汇时,鲁棒准确率达到81.2%,而干净准确率稳定在约92.2%–92.5%之间。
- 即使在词汇表扩展后,FTML仍保持高干净准确率(92.2%–92.5%),表明泛化能力未下降。
- 该方法对超参数变化具有鲁棒性,在β值范围10⁻³至10³内性能稳定,最优权衡在β=1时达成。
- FTML在多种词级攻击(包括PWWS、HLA和GA)下显著优于现有最先进基线方法,且训练开销极低。
- 该方法在不同模型间具有良好的泛化能力,在CNN、LSTM和BERT架构上均无需修改网络结构即可实现显著的鲁棒性提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。