Skip to main content
QUICK REVIEW

[论文解读] Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models

Zhiyuan Zhang, Lingjuan Lyu|arXiv (Cornell University)|Oct 18, 2022
Topic Modeling被引用 4
一句话总结

本文提出了一种名为 Fine-mixing 的新型防御方法,利用干净的预训练语言模型权重来缓解微调后 NLP 模型中的后门攻击。通过将受污染的微调权重与预训练权重混合,并在干净数据上重新微调,同时结合嵌入净化(E-PUR)技术以去除词嵌入中的触发式后门,该方法在多个 NLP 任务中实现了最先进性能,显著优于现有方法,且干净准确率下降极小。

ABSTRACT

Deep Neural Networks (DNNs) are known to be vulnerable to backdoor attacks. In Natural Language Processing (NLP), DNNs are often backdoored during the fine-tuning process of a large-scale Pre-trained Language Model (PLM) with poisoned samples. Although the clean weights of PLMs are readily available, existing methods have ignored this information in defending NLP models against backdoor attacks. In this work, we take the first step to exploit the pre-trained (unfine-tuned) weights to mitigate backdoors in fine-tuned language models. Specifically, we leverage the clean pre-trained weights via two complementary techniques: (1) a two-step Fine-mixing technique, which first mixes the backdoored weights (fine-tuned on poisoned data) with the pre-trained weights, then fine-tunes the mixed weights on a small subset of clean data; (2) an Embedding Purification (E-PUR) technique, which mitigates potential backdoors existing in the word embeddings. We compare Fine-mixing with typical backdoor mitigation methods on three single-sentence sentiment classification tasks and two sentence-pair classification tasks and show that it outperforms the baselines by a considerable margin in all scenarios. We also show that our E-PUR method can benefit existing mitigation methods. Our work establishes a simple but strong baseline defense for secure fine-tuned NLP models against backdoor attacks.

研究动机与目标

  • 为应对微调后的预训练语言模型(PLM)中日益增长的后门攻击威胁,特别是那些在微调过程中被污染的情况。
  • 利用通常被先前防御方法忽视的干净预训练模型权重,以提升后门缓解效果。
  • 开发一种强大且实用的防御框架,在保持高干净准确率的同时有效中和后门。
  • 特别针对通过词嵌入注入的后门,这类后门常被基于微调的缓解方法所忽略。

提出的方法

  • Fine-mixing 采用两步流程:首先,使用由混合比例 ρ 控制的加权平均,将受污染的微调权重与干净的预训练权重混合;其次,对混合后的权重在小规模干净数据集上进行微调。
  • 混合比例 ρ 通过超参数搜索进行优化,以在干净准确率与后门准确率降低之间取得平衡。
  • 嵌入净化(E-PUR)通过分析嵌入统计特征和词频模式,检测并移除可能被污染的词嵌入。
  • E-PUR 针对通过操纵输入标记嵌入引入的后门,这类后门仅靠权重微调难以缓解。
  • 两种技术——Fine-mixing 与 E-PUR——相辅相成:Fine-mixing 针对模型权重,而 E-PUR 针对输入层级的后门。
  • 该防御框架端到端应用于下游 NLP 任务,包括单句分类与句子对分类任务。

实验结果

研究问题

  • RQ1利用干净的预训练权重是否能显著提升微调后语言模型中的后门缓解效果?
  • RQ2两步混合与再微调策略(Fine-mixing)在降低后门成功率的同时保持干净准确率的效果如何?
  • RQ3通过触发词操作注入的嵌入级后门是否能通过专用净化技术有效缓解?
  • RQ4所提出的防御方法在多种攻击类型与 NLP 任务中与现有后门缓解基线相比表现如何?
  • RQ5影响后门缓解难度的关键因素是什么?它们如何影响 Fine-mixing 的性能?

主要发现

  • 在三个单句情感分类任务和两个句子对分类任务中,Fine-mixing 在所有评估的基线方法中表现最优,显著降低了后门攻击成功率。
  • 在所有评估场景中,Fine-mixing 仅导致干净准确率出现极小下降,展现出强大的鲁棒性与实用性。
  • E-PUR 技术能有效缓解基于嵌入的后门,并提升现有缓解方法的性能,尤其在针对词嵌入攻击时效果显著。
  • 使用随机权重选择的 Fine-mixing(Fine-mixing)优于选择性权重保留变体(Fine-mixing (Sel)),表明更广泛的参数空间探索能提升鲁棒性。
  • 当微调模型的干净准确率较高时,该方法尤为有效;但当初始模型性能较低时,由于损失曲面中局部几何结构不佳,缓解面临挑战。
  • 研究发现,句子对任务中的后门以及从零开始训练的模型中的后门,比情感分类任务或从干净 PLM 微调的模型中的后门更难缓解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。