Skip to main content
QUICK REVIEW

[論文レビュー] Universal Adversarial Perturbation for Text Classification

Hang Gao, Tim Oates|arXiv (Cornell University)|Oct 10, 2019
Adversarial Robustness in Machine Learning参考文献 29被引用数 11
ひとこと要約

本稿では、テキスト分類器の埋め込み空間において、一様で小さな摂動ベクトルを各トークンに適用することで、最新のモデルを高い確率でだますことができる普遍的 adversarial perturbations を生成する手法を提案する。このアプローチは、複数の NLP タスクで高いだます率を達成するとともに、意味的近傍性を保持しており、深層ニューラルネットワークが最小限で転送可能な摂動に対して極めて脆弱であることを示している。

ABSTRACT

Given a state-of-the-art deep neural network text classifier, we show the existence of a universal and very small perturbation vector (in the embedding space) that causes natural text to be misclassified with high probability. Unlike images on which a single fixed-size adversarial perturbation can be found, text is of variable length, so we define the "universality" as "token-agnostic", where a single perturbation is applied to each token, resulting in different perturbations of flexible sizes at the sequence level. We propose an algorithm to compute universal adversarial perturbations, and show that the state-of-the-art deep neural networks are highly vulnerable to them, even though they keep the neighborhood of tokens mostly preserved. We also show how to use these adversarial perturbations to generate adversarial text samples. The surprising existence of universal "token-agnostic" adversarial perturbations may reveal important properties of a text classifier.

研究の動機と目的

  • 深層ニューラルネットワークのテキスト分類器を普遍的にだますことのできる、小さな摂動が埋め込み空間に存在するかを調査すること。
  • 入力サンプルの長さに依存しない、このような普遍的 adversarial perturbations を計算するためのアルゴリズムを開発すること。
  • 分類を回避する際の意味的・構文的妥当性を保ちながら、adversarial テキストサンプルを生成すること。
  • 多様な NLP タスクにおける最先端のテキスト分類器の堅牢性を、これらの普遍的摂動の下で評価すること。

提案手法

  • 本手法は、すべての訓練サンプルにおいて誤分類損失を最大化する最適化問題として、普遍的 adversarial perturbation を定式化する。その際、小さな p ノルム(p=2)を制約条件として用いる。
  • 摂動ベクトル δ に対して勾配上昇を用い、正規化された勾配を用いることで、摂動が lp ノルムの ε 範囲内に保たれるようにする。
  • アルゴリズムは訓練データのミニバッチを繰り返し用い、各ステップ後に δ を lp 球内に再投影することで、ノルム制約を維持する。
  • 摂動は入力シーケンス内の各トークンに一様に適用されるため、'トークンに依存しない'(token-agnostic)となる。つまり、文脈に関係なく各トークンに同じ δ が適用される。
  • adversarial サンプルは、各トークンを摂動された埋め込み空間内での最近傍に置き換えることで生成され、摂動されたベクトルとのコサイン類似度を最大化する。
  • 本手法は、正規化された勾配を用い、検証データでの早期停止を適用し、Adam を用いて訓練する。固定された ε を用いることで、人間が感知できないように保証する。

実験結果

リサーチクエスチョン

  • RQ1埋め込み空間における一様で小さな摂動が、多様な入力およびタスクにおいて深層ニューラルネットワークのテキスト分類器を普遍的にだすことができるか?
  • RQ2意味的近傍性を保ちながら、adversarial な例を生成するにあたり、トークンに依存しない摂動戦略はどの程度有効か?
  • RQ3高いだます性能を得るために必要な最小限のトレーニングデータ量はどれくらいか?
  • RQ4ランダムまたは語彙ベースのベースライン摂動と比較して、本手法のだます率および意味的保持性はどのように異なるか?
  • RQ5この摂動は、異なる NLP タスクおよびモデルアーキテクチャ間でどの程度転送可能か?

主な発見

  • 提案手法は MRPC タスクで 95.9% のだます率を達成し、ランダムおよび語彙ベースのベースラインをすべて上回った。
  • トレーニングデータの 10% のみで、SST-2 で 87.7% の精度を達成しており、高いデータ効率性とスケーラビリティを示している。
  • MRPC での NI(V) スコアが 0.959 であったことから、語彙ベースのベースラインよりも摂動がトークンの近傍性をよりよく保持していることが示された。
  • ε を 0.2 に設定しても、本手法は高いだます性能を維持しており、埋め込みノルムの観点から摂動が人間にとって感知されないままであることが示された。
  • 本手法により生成された adversarial サンプルは、言語的に妥当であり、一貫した誤分類を引き起こす。表 5 に示すように、構文的変更のみで予測が反転している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。