Skip to main content
QUICK REVIEW

[論文レビュー] Defending Pre-trained Language Models from Adversarial Word Substitutions Without Performance Sacrifice

Rongzhou Bao, Jiayi Wang|arXiv (Cornell University)|May 30, 2021
Adversarial Robustness in Machine Learning参考文献 23被引用数 4
ひとこと要約

本稿では、事前学習言語モデル(PrLM)に対する敵対的語置換攻撃を、性能の低下を伴わずに防御するコンパクトな防御フレームワーク ADFAR を提案する。敵対的入力を検出し、それらにのみターゲットドのランダム化を適用することで、元の精度を保持しつつ、優れた耐性と高速な推論速度を達成する。

ABSTRACT

Pre-trained contextualized language models (PrLMs) have led to strong performance gains in downstream natural language understanding tasks. However, PrLMs can still be easily fooled by adversarial word substitution, which is one of the most challenging textual adversarial attack methods. Existing defence approaches suffer from notable performance loss and complexities. Thus, this paper presents a compact and performance-preserved framework, Anomaly Detection with Frequency-Aware Randomization (ADFAR). In detail, we design an auxiliary anomaly detection classifier and adopt a multi-task learning procedure, by which PrLMs are able to distinguish adversarial input samples. Then, in order to defend adversarial word substitution, a frequency-aware randomization process is applied to those recognized adversarial input samples. Empirical results show that ADFAR significantly outperforms those newly proposed defense methods over various tasks with much higher inference speed. Remarkably, ADFAR does not impair the overall performance of PrLMs. The code is available at https://github.com/LilyNLP/ADFAR

研究の動機と目的

  • 文法的正しさと意味的一貫性を保ったまま攻撃が可能な敵対的語置換攻撃に対する、事前学習言語モデル(PrLM)の脆弱性を是正すること。
  • 既存の防御手法で一般的に見られる性能低下を回避し、非敵対的入力においても高い予測精度を維持する防御メカニズムの開発。
  • 実世界での導入に適した低計算コストの効率的で低複雑性の防御フレームワークの設計。
  • 広範な再訓練やモデルの変更を必要とせず、ヒューリスティックな語置換攻撃に対して耐性を持つこと。

提案手法

  • 主な PrLM と並行してマルチタスク学習により、敵対的入力サンプルを同定する補助の異常検出分類器を訓練する。
  • 検出された敵対的入力のみが推論時に周波数に配慮したランダム化処理を経る。この処理では、語の置換により敵対的影響を低減する。
  • 周波数に配慮した戦略では、希少語をより頻出する同義語に置換することを優先し、PrLM が頻出語に対してより頑健であるという観察を活用する。
  • ランダム化は敵対的サンプルにのみ適用されるため、クリーンな入力に対しては元の予測パイプラインが維持され、性能の損なわれない。
  • 同義語集合の構築には周波数閾値を用いて、意味的・文法的に妥当な置換のみを考慮する。
  • 訓練プロセスでは、制御された置換率を用いた周波数に配慮したランダム化を組み込み、訓練データを拡張し、耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1非敵対的入力における性能の低下を伴わずに、敵対的語置換を検出できる防御フレームワークは実現可能か?
  • RQ2周波数に配慮したランダム化は、敵対的語置換攻撃の緩和にどの程度効果的か?
  • RQ3語置換攻撃の文脈において、補助の異常検出器は敵対的入力とクリーンな入力を信頼性高く区別できるか?
  • RQ4耐性と推論効率の最適なバランスをとるには、置換率と同義語集合のサイズの最適な組み合わせは何か?
  • RQ5異常検出と周波数に配慮したランダム化の組み合わせは、既存の防御手法に比べ、耐性と推論速度の両面で優れているか?

主な発見

  • ADFAR は、Ye ら(2020)およびZhou ら(2019)の手法と比較して、複数の NLP タスクで顕著に高い敵対的精度を達成する。
  • 非敵対的入力においても元の予測精度が保持されており、性能の損なわれないことが確認された。
  • 推論時における置換率が30%、訓練時が25%の際に最高の敵対的精度が得られ、耐性と忠実度の最適なトレードオフが示された。
  • 周波数に配慮したランダム化が防御に最も貢献しており、希少語がより頻出する同義語に置換された際に性能がピークに達した。
  • 補助の異常検出器は、現在のヒューリスティックな語置換戦略によって生成された敵対的サンプルを効果的に同定でき、ランダム化の的確な適用を可能にした。
  • ADFAR は、既存の防御手法に比べて顕著に高速な推論速度を示し、リアルタイム導入に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。