[論文レビュー] Adversarial Training with Fast Gradient Projection Method against Synonym Substitution based Text Attacks
本稿では、文書の類義語置換を用いて、既存の手法と比較して最大20倍高速に悪意ある例を生成できる、非常に効率的な勾配ベースの悪意ある攻撃手法であるFast Gradient Projection Method (FGPM) を提案する。この攻撃は、高い攻撃性能を維持しつつ、実用的な悪意ある訓練への統合を可能にする。さらに、論理出力ペアリングを活用した新たな悪意ある訓練防御手法ATFLを導入し、モデルの耐性を著しく向上させるとともに、悪意ある例の転送性を遮断し、クリーンデータに対する一般化性能を従来の防御手法を上回る。
Adversarial training is the most empirically successful approach in improving the robustness of deep neural networks for image classification.For text classification, however, existing synonym substitution based adversarial attacks are effective but not efficient to be incorporated into practical text adversarial training. Gradient-based attacks, which are very efficient for images, are hard to be implemented for synonym substitution based text attacks due to the lexical, grammatical and semantic constraints and the discrete text input space. Thereby, we propose a fast text adversarial attack method called Fast Gradient Projection Method (FGPM) based on synonym substitution, which is about 20 times faster than existing text attack methods and could achieve similar attack performance. We then incorporate FGPM with adversarial training and propose a text defense method called Adversarial Training with FGPM enhanced by Logit pairing (ATFL). Experiments show that ATFL could significantly improve the model robustness and block the transferability of adversarial examples.
研究の動機と目的
- 既存の類義語置換に基づく文書用悪意ある攻撃の非効率性を是正し、実用的な悪意ある訓練への統合を可能にする。
- 文書の離散的かつ制約付き空間を効率的に走破しつつ、意味的・文法的整合性を保ちながら勾配ベースの攻撃手法を開発する。
- 攻撃生成の計算ボトル neck を克服することで、文書分類における効果的な悪意ある訓練を可能にする。
- 悪意ある例の転送性を遮断し、クリーンデータに対する一般化性能を向上させる防御手法を提案する。
- 画像分野で成功した悪意ある訓練正則化手法(例:TRADES, MMA)が、テキスト分野にも一般化可能かどうかを調査する。
提案手法
- 類義語置換の影響を、埋め込み空間における勾配の大きさと射影距離の積を用いて近似する勾配ベースの攻撃手法FGPMを提案する。
- 各ステップで、勾配の方向に従い、信頼度の変化を最大にする類義語置換を選択することで、単語ごとに1回の勾配計算で高速化を実現する。
- FGPMが生成した悪意ある例と論理出力ペアリング正則化を組み合わせた防御手法ATFLを導入し、耐性と一般化性能を向上させる。
- ATFLにおける論理出力ペアリングは、元の例と悪意ある例の両方に対するモデルの予測の一貫性を促進し、訓練中の耐性を強化する。
- 単語ごとに1回のバックプロパゲーションで勾配を計算するため、クエリベースの手法と比較して計算時間を著しく削減する。
- 白ボックスおよびブラックボックス攻撃設定の下で、標準的な文書ベンチマーク(AG’s News, IMDB, DBPedia)に対して評価を実施する。
実験結果
リサーチクエスチョン
- RQ1離散的かつ制約付きの文書空間に、勾配ベースの手法を効率的に適応させ、類義語置換に基づく悪意ある例を生成できるか?
- RQ2FGPMは、既存の類義語置換攻撃手法と比較して、速度と攻撃成功確率の面でどの程度優れているか?
- RQ3FGPMは、白ボックスおよびブラックボックス攻撃に対するモデル耐性を向上させるために、悪意ある訓練に効果的に統合できるか?
- RQ4ATFLは、モデルやデータセット間で悪意ある例の転送性を効果的に遮断できるか?
- RQ5画像分野で成功した正則化手法(例:TRADES, MMA)は、テキスト分類分野にも効果的に一般化できるか?
主な発見
- FGPMは、最先端の類義語置換攻撃と同等の攻撃成功確率を達成しながら、現在最も速い手法と比較して約20倍高速である。
- ATFLは、AG’s News、IMDB、DBPediaの各データセットにおいて、白ボックスおよびブラックボックス攻撃に対して、モデルの耐性を著しく向上させる。
- ATFLは悪意ある例の転送性を効果的に遮断し、大多数の防御ベースラインを上回り、Bi-LSTMにおけるSEMの最良性能に匹敵する。
- ATFLは、SEM や標準的な悪意ある訓練を含む他の防御手法と比較して、クリーン(良性)データに対する一般化性能が優れている。
- 最近開発された画像固有の悪意ある訓練変種(例:TRADES, MMA)は、テキスト分野では性能を低下させることが示され、画像とテキストの悪意ある訓練における根本的な違いを示している。
- 提案されたFGPMは、離散的テキスト空間における効率的な勾配ベースの悪意ある訓練を可能にし、画像分野で成功した悪意ある手法を自然言語処理分野に適応する道を切り開く。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。