Skip to main content
QUICK REVIEW

[論文レビュー] Black-box Generation of Adversarial Text Sequences to Evade Deep Learning Classifiers

Ji Gao, Jack Lanchantin|arXiv (Cornell University)|Jan 13, 2018
Adversarial Robustness in Machine Learning参考文献 23被引用数 57
ひとこと要約

本論文は、トークンの重要性を評価し文字レベルの変換を適用することにより、深層学習分類器を誤分類させる小さく知覚されにくいテキスト摂動を生成するブラックボックス手法 DeepWordBug を提示します。

ABSTRACT

Although various techniques have been proposed to generate adversarial samples for white-box attacks on text, little attention has been paid to black-box attacks, which are more realistic scenarios. In this paper, we present a novel algorithm, DeepWordBug, to effectively generate small text perturbations in a black-box setting that forces a deep-learning classifier to misclassify a text input. We employ novel scoring strategies to identify the critical tokens that, if modified, cause the classifier to make an incorrect prediction. Simple character-level transformations are applied to the highest-ranked tokens in order to minimize the edit distance of the perturbation, yet change the original classification. We evaluated DeepWordBug on eight real-world text datasets, including text classification, sentiment analysis, and spam detection. We compare the result of DeepWordBug with two baselines: Random (Black-box) and Gradient (White-box). Our experimental results indicate that DeepWordBug reduces the prediction accuracy of current state-of-the-art deep-learning models, including a decrease of 68\% on average for a Word-LSTM model and 48\% on average for a Char-CNN model.

研究の動機と目的

  • モデルパラメータや勾配を必要としない NLP 分類器に対するブラックボックスの敵対的攻撃を実証する。
  • モデル非依存のスコアリング関数を用いて分類器の決定を導く重要なトークンを特定する。
  • それらのトークンに小さく知覚できない文字レベルの摂動を適用して誤分類を誘発する。
  • 複数のデータセットとモデルアーキテクチャ(Word-LSTM および Char-CNN)にわたって攻撃の有効性を評価する。
  • モデル間での敵対的サンプルの転移性とパラメータ選択に対する頑健性を評価する。

提案手法

  • モデルパラメータなしでトークンの重要性を評価するために、4つのトークンスコアリング関数(Replace-1、Temporal Head、Temporal Tail、Combined)を定義する。
  • アウトオブボキャブラリトークンで置換した場合のモデル出力や逐次予測の差分を用いて重要度でトークンをランク付けする。
  • 上位 m 個のトークンを選択し、単純で小さな文字レベルの変換(置換、代替、削除、挿入)で摂動を加え、敵対的サンプルを作成する。
  • Levenshtein 編集距離を摂動の制約として用い、知覚的な変化を小さく保つ。
  • 攻撃アルゴリズム DeepWordBug は入力長に対して O(n) のクエリで動作します。

実験結果

リサーチクエスチョン

  • RQ1勾配やモデル内部情報なしで、ブラックボックスの敵対的攻撃がNLPモデルの精度を大幅に低下させることができるか?
  • RQ2あるモデルのために生成された敵対的サンプルは、同じタスクの他のモデルに効果的に転移するか?
  • RQ3DeepWordBug のスコアリングと変換戦略は、辞書サイズや変換の選択肢の違いに対してどれだけ頑健か?
  • RQ4さまざまなテキストデータセットとアーキテクチャ(語レベル LSTM および文字レベル CNN)における DeepWordBug の有効性はどうか?

主な発見

  • DeepWordBug は8つのデータセット全体で精度を大幅に低下させ、摂動予算 ϵ = 30 の下で Word-LSTM の平均低下率が 68%、Char-CNN の平均低下率が 48% に達した。
  • Combined scoring with Substitution transformer は Word-LSTM の AG’s News および Amazon Review Polarity の精度を劇的に低下させた(例: AG’s News で約90%から約25%へ)。
  • Replace-1 スコアリングと Substitution transformer の組み合わせは Char-CNN にとって非常に効果的で、Amazon Review Polarity で約90%から約46%へ。
  • 攻撃サンプルはモデル間で転移が良く、別のアーキテクチャや埋め込みで精度を約90%から20–50%まで低下させる。
  • ランダムスコアリングは性能が低く、勾配情報を用いるホワイトボックスのベースラインよりも、提案されたスコアリング関数が優れており、モデル非依存のトークン重要性の価値を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。