Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Discriminate Perturbations for Blocking Adversarial Attacks in Text Classification

Yichao Zhou, Jyun‐Yu Jiang|arXiv (Cornell University)|Sep 6, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用数 16
ひとこと要約

本稿では、モデルの微調整なしに、テキスト分類における敵対的摂動を特定・回復する新しい防御フレームワークDISPを提案する。k-NN探索を用いた摂動識別器と埋め込み推定器により、元の意味を回復し攻撃を遮断する。SST-2およびIMDbにおいて、ベースラインを著しく上回り、異なるデータセット間で高い耐性を示す。

ABSTRACT

Adversarial attacks against machine learning models have threatened various real-world applications such as spam filtering and sentiment analysis. In this paper, we propose a novel framework, learning to DIScriminate Perturbations (DISP), to identify and adjust malicious perturbations, thereby blocking adversarial attacks for text classification models. To identify adversarial attacks, a perturbation discriminator validates how likely a token in the text is perturbed and provides a set of potential perturbations. For each potential perturbation, an embedding estimator learns to restore the embedding of the original word based on the context and a replacement token is chosen based on approximate kNN search. DISP can block adversarial attacks for any NLP model without modifying the model structure or training procedure. Extensive experiments on two benchmark datasets demonstrate that DISP significantly outperforms baseline methods in blocking adversarial attacks for text classification. In addition, in-depth analysis shows the robustness of DISP across different situations.

研究の動機と目的

  • モデルのアーキテクチャや学習を変更せずに、NLPモデルに対する敵対的攻撃に対処すること。
  • 離散的トークン空間と大規模な語彙のため、検出が難しい、意味的に妥当な摂動を特定する防御機構を開発すること。
  • 文脈化された埋め込みと効率的な近隣探索を用いて、摂動を受けていたトークンを回復し、文の整合性と予測精度を維持すること。
  • ターゲットデータに再訓練なしに、異なるテキストコーパスやNLPタスク間で防御を転送可能にすること。
  • 既存モデルに対して即時利用可能なソリューションを提供し、単語レベルおよび文字レベルの操作を含む多様な攻撃タイプに対して耐性を高めること。

提案手法

  • 敵対的例を用いた対照学習の目的関数に基づき、各トークンが摂動済みか否かを分類する摂動識別器を学習する。
  • 事前学習済みコーパスを用いて、文脈と候補となる置換トークンから元の単語埋め込みを再構成する埋め込み推定器を学習する。
  • 識別された摂動済みトークンごとに、事前に計算済みのトークン埋め込みの階層的ナビゲーション可能な小さな世界(HNSW)グラフ上でk-NN探索を実行し、意味的に最も類似した単語を特定する。
  • フレームワークは、ターゲットNLPモデルの再訓練を必要としない後処理モジュールとして動作し、即時導入が可能である。
  • トークン回復時に文脈化された表現を活用することで、意味的一致性を確保し、性能低下を最小限に抑える。
  • 敵対的例上でエンドツーエンドに学習されることで、攻撃タイプやデータセットに一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1ターゲットモデルのアーキテクチャや学習を変更せずに、テキストにおける敵対的摂動を検出し回復できる防御機構は存在するか?
  • RQ2本稿で提案するフレームワークは、語の置換、挿入、削除、文字レベルの入れ替えを含む、さまざまなタイプの敵対的攻撃に対してどれほど効果的か?
  • RQ3摂動識別器と埋め込み推定器は、異なるテキストコーパスやNLPタスクにどれほど一般化可能か?
  • RQ4文脈が疎であったり、複数の摂動が同時に存在する場合、防御の性能はどの程度低下するか?
  • RQ5再訓練なしに、あるデータセット(例:IMDb)から別のデータセット(例:SST-2)に防御を転送できるか?

主な発見

  • SST-2データセットにおいて、スワップ攻撃下でDISPは87.96%の精度を達成し、ベースライン手法を著しく上回った。
  • IMDbデータセットでは、削除攻撃下でもDISPは86.81%の精度を維持し、さまざまな攻撃タイプに対して強い耐性を示した。
  • 転送防御設定では、IMDbで学習したDISPがSST-2で学習したモデルと同等の性能を示し、優れたデータセット間一般化能力を示した。
  • 埋め込み推定器は、SST-2でRMSEが0.0442、IMDbで0.1030と低く、元の単語埋め込みの高品質な再構成を達成した。
  • CoLAにおける文法的妥当性分類では、敵対的攻撃下でBERTの性能低下(0.1209)をDISPが0.5502の精度にまで低減させ、感情分析を超えた有効性を示した。
  • 事例研究により、DISPは「orignal」を「original」や「bet」を「best」に正常に回復できたが、文脈が不足している場合や複数の摂動が存在する場合には性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。