Skip to main content
QUICK REVIEW

[論文レビュー] Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models

Zhiyuan Zhang, Lingjuan Lyu|arXiv (Cornell University)|Oct 18, 2022
Topic Modeling被引用数 4
ひとこと要約

本稿では、クリーンな事前学習済み言語モデル重みを活用して微調整済みNLPモデルにおけるバックドアを軽減する、新しい防御手法Fine-mixingを提案する。バックドア付きの微調整済み重みと事前学習済み重みを混合し、クリーンデータ上で再微調整することで、単語埋め込みにおけるトリガーに基づくバックドアを除去するEmbedding Purification (E-PUR)と組み合わせることで、複数のNLPタスクにおいて、クリーン精度の低下を最小限に抑えつつ、最先端の性能を達成する。

ABSTRACT

Deep Neural Networks (DNNs) are known to be vulnerable to backdoor attacks. In Natural Language Processing (NLP), DNNs are often backdoored during the fine-tuning process of a large-scale Pre-trained Language Model (PLM) with poisoned samples. Although the clean weights of PLMs are readily available, existing methods have ignored this information in defending NLP models against backdoor attacks. In this work, we take the first step to exploit the pre-trained (unfine-tuned) weights to mitigate backdoors in fine-tuned language models. Specifically, we leverage the clean pre-trained weights via two complementary techniques: (1) a two-step Fine-mixing technique, which first mixes the backdoored weights (fine-tuned on poisoned data) with the pre-trained weights, then fine-tunes the mixed weights on a small subset of clean data; (2) an Embedding Purification (E-PUR) technique, which mitigates potential backdoors existing in the word embeddings. We compare Fine-mixing with typical backdoor mitigation methods on three single-sentence sentiment classification tasks and two sentence-pair classification tasks and show that it outperforms the baselines by a considerable margin in all scenarios. We also show that our E-PUR method can benefit existing mitigation methods. Our work establishes a simple but strong baseline defense for secure fine-tuned NLP models against backdoor attacks.

研究の動機と目的

  • 微調整中に汚染された場合に特に深刻な脅威となる、微調整済み事前学習済み言語モデル(PLM)におけるバックドア攻撃の増加に対処すること。
  • 従来の防御で軽視されがちな、利用可能なクリーンな事前学習済みモデル重みを活用して、バックドア軽減を改善すること。
  • 高いクリーン精度を維持しながらも、バックドアを効果的に無効化できる、強固で実用的な防御フレームワークを開発すること。
  • 特にトリガー語の操作によって注入されるバックドアに特化して、単語埋め込みレベルのバックドアを効果的に軽減すること。

提案手法

  • Fine-mixingは二段階のプロセスを実行する:まず、混合比ρで制御される重み付き平均を用いて、バックドア付きの微調整済み重みとクリーンな事前学習済み重みを混合する。次に、その混合重みを小規模なクリーンデータセット上で再微調整する。
  • 混合比ρはハイパーパrameterサーチにより最適化され、クリーン精度とバックドア精度の低下のバランスを取る。
  • Embed入浄化(E-PUR)は、埋め込み統計と語の頻度パターンを分析することで、汚染された可能性のある単語埋め込みを検出し、削除する。
  • E-PURは、入力トークン埋め込みを操作するバックドアを標的とし、重みの微調整だけでは対処しきれない問題に焦点を当てる。
  • Fine-mixingとE-PURの二つの技術は補完的である:Fine-mixingはモデル重みに、E-PURは入力レベルのバックドアにそれぞれ対処する。
  • この防御フレームワークは、単一文分類および文対分類を含む、下流のNLPタスクにエンドツーエンドで適用される。

実験結果

リサーチクエスチョン

  • RQ1クリーンな事前学習済み重みを活用することで、微調整済み言語モデルにおけるバックドア軽減が著しく改善されるか?
  • RQ2二段階の混合と再微調整戦略(Fine-mixing)は、クリーン精度を維持しつつバックドアの成功率をどれほど低減できるか?
  • RQ3特にトリガー語の操作によって注入される埋め込みレベルのバックドアは、専用の浄化技術によって効果的に軽減可能か?
  • RQ4提案手法は、多様な攻撃タイプとNLPタスクにおいて、既存のバックドア軽減ベースラインと比較してどのように優れているか?
  • RQ5バックドア軽減の難易度に影響を与える主な要因は何か? また、それらはFine-mixingの性能にどのように影響するか?

主な発見

  • Fine-mixingは、3つの単一文センチメント分類タスクと2つの文対分類タスクにおいて、すべてのベースライン手法を上回り、顕著に低いバックドア攻撃成功率を達成した。
  • 評価されたすべてのシナリオにおいて、Fine-mixingはクリーン精度の低下を最小限に抑え、高い耐性と実用性を示した。
  • E-PUR技術は埋め込みベースのバックドアを効果的に軽減し、特に単語埋め込みを標的にする攻撃に対して、既存の軽減手法の性能を向上させた。
  • ランダムな重み選択を用いたFine-mixing(Fine-mixing)は、選択的重み保留バージョン(Fine-mixing (Sel))を上回り、より広範なパラメータ空間の探索が耐性向上に寄与することを示した。
  • 微調整済みモデルのクリーン精度が高ければ高いほど、本手法は特に効果的であるが、損失関数の局所幾何が悪い場合、初期モデル性能が低いと対処が困難になる。
  • 本研究では、文対タスクや事前学習済みPLMから微調整したモデルとは異なり、スクラッチから訓練したモデルや文対タスクにおけるバックドアは、センチメント分類タスクやクリーンなPLMからの微調整モデルと比較して、より軽減が難しいことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。