Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Adversarial Attacks on Text Classifiers

Zhouhang Xie, Jonathan Brophy|arXiv (Cornell University)|Jan 21, 2022
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

本稿では、変更されたテキストの特徴を分析することで、テキスト分類器に対する adversarial 攻撃を同定するための新規アプローチを提示している。150万件の攻撃インスタンスを含む新しいベンチマークデータセット(TCAB)を用い、テキスト、言語モデル、ターゲットモデルの特徴を組み合わせた(TLC)手法により、97%の精度で攻撃を正確に検出・同定できることを示している。これは、未学習の攻撃に対しても一般化可能である。

ABSTRACT

The landscape of adversarial attacks against text classifiers continues to grow, with new attacks developed every year and many of them available in standard toolkits, such as TextAttack and OpenAttack. In response, there is a growing body of work on robust learning, which reduces vulnerability to these attacks, though sometimes at a high cost in compute time or accuracy. In this paper, we take an alternate approach -- we attempt to understand the attacker by analyzing adversarial text to determine which methods were used to create it. Our first contribution is an extensive dataset for attack detection and labeling: 1.5~million attack instances, generated by twelve adversarial attacks targeting three classifiers trained on six source datasets for sentiment analysis and abuse detection in English. As our second contribution, we use this dataset to develop and benchmark a number of classifiers for attack identification -- determining if a given text has been adversarially manipulated and by which attack. As a third contribution, we demonstrate the effectiveness of three classes of features for these tasks: text properties, capturing content and presentation of text; language model properties, determining which tokens are more or less probable throughout the input; and target model properties, representing how the text classifier is influenced by the attack, including internal node activations. Overall, this represents a first step towards forensics for adversarial attacks against text classifiers.

研究の動機と目的

  • NLP モデルに対する adversarial 攻撃の増加する脅威に対処し、与えられたテキストがどの攻撃手法によって生成されたかを同定すること。
  • 攻撃同定モデルの学習および評価を目的とした包括的なベンチマークデータセット(TCAB)の開発。
  • テキスト特徴、言語モデル特徴、ターゲットモデル特徴の3つの特徴クラスの有効性を、異なる adversarial 攻撃手法の区別にどう寄与するかを調査すること。
  • 攻撃のフォレンジック分析を可能にし、実世界の応用における悪意ある行動を特定する防御戦略を支援すること。
  • 攻撃同定モデルが、学習時に見なかった攻撃に対しても一般化できることを示すことにより、実用的展開における耐性を高めること。

提案手法

  • 著者らは、3つのトランスフォーマー基盤の分類器を用い、6つのデータセット(感情分析および嫌がらせ検出用)で12種類の攻撃を適用し、合計150万件の adversarial 例を含む「テキスト分類攻撃ベンチマーク(TCAB)」を構築した。
  • 3種類の特徴を抽出した:テキスト特徴(例:単語長、句読点、非ASCII文字)、言語モデル特徴(例:トークン確率、パープレキシティ)、ターゲットモデル特徴(例:内部活性化、勾配、セマンティック感度)。
  • これらの特徴を BERT 埋め込みと組み合わせ、攻撃検出・同定のための線形および木ベースのアンサンブル分類器を学習した。
  • モデルは、ドメイン内およびドメイン外の設定で評価され、未学習の攻撃への一般化能力がテストされた。
  • 各特徴タイプが攻撃同定性能に与える寄与度を評価するための特徴の除去(ablation)研究が実施された。
  • 今後の研究およびモデル拡張を支援するため、データセットとコードを公開した。

実験結果

リサーチクエスチョン

  • RQ1テキスト、言語モデル、およびモデル固有の特徴を組み合わせることで、adversarial 攻撃を正確に同定できるか?
  • RQ2訓練時に見なかった攻撃に対し、攻撃同定モデルの一般化性能はどの程度高いか?
  • RQ3テキスト特徴、言語モデル特徴、ターゲットモデル特徴のうち、どれが攻撃同定性能に最も寄与するか?
  • RQ4攻撃同定が、ソーシャルメディアやフェイクニュースの文脈における悪意ある行動やキャンペーンを追跡するフォレンジックツールとして利用可能か?
  • RQ5訓練時に使用したターゲットモデルと推論時に使用するモデルが一致するか異なる場合、攻撃同定の性能上限はどの程度か?

主な発見

  • 攻撃検出(攻撃が存在するかどうかの判別)は、攻撃を生成したターゲットモデルと特徴抽出に使用するモデルが一致する場合、84–97%の精度を達成した。
  • 訓練時と推論時のターゲットモデルが異なる場合、精度は83–91%に低下したが、依然として高い一般化能力を示した。
  • 未学習の攻撃に対してもモデルは効果的に一般化され、訓練データに含まれない攻撃タイプに対しても高い検出性能を維持した。
  • テキスト特徴(T)、言語モデル特徴(L)、ターゲットモデル特徴(C)が統合されたTLC特徴セットは、ベースライン手法よりも攻撃同定性能を顕著に向上させた。
  • 3つの特徴タイプの中で、ターゲットモデル特徴(C)が同定性能に最も寄与し、次に言語モデル特徴(L)、テキスト特徴(T)の順であった。
  • 最良のモデルは、SST-2 データセットでドメイン内ターゲットモデルを用いた場合、97%の精度を達成し、提案手法の高い有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。