Skip to main content
QUICK REVIEW

[論文レビュー] CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation

Tianlu Wang, Xuezhi Wang|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 25被引用数 7
ひとこと要約

CAT-Genは、感情分析における製品カテゴリなど、タスクに無関係な属性を制御的に用いることで、多様で流暢な敵対的例を生成する制御可能な敵対的テキスト生成フレームワークを提案する。属性学習と攻撃生成を分離し、事前学習済み言語モデルを活用することで、従来の手法に比べて文脈的・構文的に元の入力に近いが、分類器を欺く能力に優れた、より頑健な敵対的例を生成する。このフレームワークは、モデルの再訓練やアーキテクチャ変更に対しても、文書の流れや多様性、移行性の観点で優れた性能を示す。

ABSTRACT

NLP models are shown to suffer from robustness issues, i.e., a model's prediction can be easily changed under small perturbations to the input. In this work, we present a Controlled Adversarial Text Generation (CAT-Gen) model that, given an input text, generates adversarial texts through controllable attributes that are known to be invariant to task labels. For example, in order to attack a model for sentiment classification over product reviews, we can use the product categories as the controllable attribute which would not change the sentiment of the reviews. Experiments on real-world NLP datasets demonstrate that our method can generate more diverse and fluent adversarial texts, compared to many existing adversarial text generation approaches. We further use our generated adversarial examples to improve models through adversarial training, and we demonstrate that our generated attacks are more robust against model re-training and different model architectures.

研究の動機と目的

  • 単語置換や連続表現による摂動によって入力を変更する従来の敵対的テキスト生成手法における多様性と文書の流れの欠如を是正する。
  • 元の入力と意味的に近く、分類器を欺くことができる高品質な敵対的例を生成することで、モデルの頑健性を向上させる。
  • モデルの再訓練やアーキテクチャ変更に対しても耐性を持つ敵対的例を用いて、頑健性の評価と訓練を可能にする。
  • 事前指定されたラベルに無関係な属性(例:ドメイン、性別、カテゴリ)を用いて、属性学習と攻撃生成を分離する。
  • 制御可能な属性操作が、より効果的な敵対的訓練と、異なるモデル間での強力な一般化を実現することを示す。

提案手法

  • 大規模なテキストコーパスで事前学習されたエンコーダ・デコーダアーキテクチャを用いて、流暢で多様な敵対的テキストを生成する。
  • 主なタスクラベルとは無関係であることが知られている属性(例:製品カテゴリ、性別)を制御的にエンコードするモジュールネットワークを導入する。
  • 入力テキストと指定された属性をデコーダの条件として用いることで、標的となる摂動を実現するテキスト生成を制御する。
  • 平行データを必要とせず、補助データセットを用いて属性モジュールを学習させることで、属性の分離学習を可能にする。
  • 意味的・構文的空間における元の入力からの逸脱を最小限に抑えつつ、攻撃成功確率を最大化するように生成プロセスを最適化する。
  • 自動評価指標として、言語モデルのパープレクサリティとBLEU-4スコアを用い、生成された敵対的例の文書の流れと多様性を評価する。

実験結果

リサーチクエスチョン

  • RQ1テキスト生成における制御可能な属性操作は、単語置換や埋め込みレベルの摂動と比較して、より流暢で多様な敵対的例を生成できるか?
  • RQ2CAT-Genが生成する敵対的例の頑健性は、モデルの再訓練やアーキテクチャ変更の下で、従来の手法と比較してどの程度優れているか?
  • RQ3CAT-Genが生成する敵対的例を用いた敵対的訓練は、モデルの頑健性をどの程度向上させられるか?
  • RQ4事前に指定されたタスクに無関係な属性を用いることで、より意味的に整合性があり、移行性の高い敵対的攻撃が可能になるか?
  • RQ5手動で指定された属性に依存せずに、脆弱な属性を自動で同定するフレームワークへの拡張は可能か?

主な発見

  • CAT-Genは、TextFooler(1853.7)やNL-adv(964.3)と比較して、著しく低いパープレクサリティ(例:言語モデル1では729.5)を達成しており、文書の流れが優れていることを示している。
  • CAT-Genは、TextFooler(68.9)やNL-adv(64.3)と比較して、より高いBLEU-4スコア(38.8)を達成しており、生成出力の多様性が優れていることを示している。
  • 再訓練されたWordCNNモデルにおいて、CAT-Gen攻撃の成功確率は49.3%を維持しており、TextFooler(84.7%)やNL-adv(82.9%)を上回る移行性を示している。
  • 別のアーキテクチャ(WordLSTM)でテストした場合、CAT-Gen攻撃は51.5%の最低成功確率を示しており、アーキテクチャの変更に対しても優れた頑健性を示している。
  • CAT-Genの例を用いた敵対的訓練により、ホールドアウトの敵対的セットにおけるモデルの正確性が92.5%まで向上し、ベースライン(例:TextFoolerの増強では52.7%)を著しく上回った。
  • CAT-Genの例で訓練されたモデルは、他の手法で生成された攻撃に対しても、84.4–83.4の高い正確性を維持しており、強力な一般化性と頑健性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。