[論文レビュー] Generating Natural Language Adversarial Examples on a Large Scale with Generative Models
本稿では、敵対的損失とGAN風の識別器を強化した条件付き変分オートエンコーダー(VAE)を用いて、元の入力に依存せずにスケーラブルかつエンド・ツー・エンドに大規模で高品質な自然言語敵対的例を生成する、制限のない新規生成手法を提案する。この手法は、既存の入力に依存せず、多様で人間が妥当と認めるテキストを生成できるため、対比較手法に比べて攻撃成功率が高く、テキストの質も優れている。
Today text classification models have been widely used. However, these classifiers are found to be easily fooled by adversarial examples. Fortunately, standard attacking methods generate adversarial texts in a pair-wise way, that is, an adversarial text can only be created from a real-world text by replacing a few words. In many applications, these texts are limited in numbers, therefore their corresponding adversarial examples are often not diverse enough and sometimes hard to read, thus can be easily detected by humans and cannot create chaos at a large scale. In this paper, we propose an end to end solution to efficiently generate adversarial texts from scratch using generative models, which are not restricted to perturbing the given texts. We call it unrestricted adversarial text generation. Specifically, we train a conditional variational autoencoder (VAE) with an additional adversarial loss to guide the generation of adversarial examples. Moreover, to improve the validity of adversarial texts, we utilize discrimators and the training framework of generative adversarial networks (GANs) to make adversarial texts consistent with real data. Experimental results on sentiment analysis demonstrate the scalability and efficiency of our method. It can attack text classification models with a higher success rate than existing methods, and provide acceptable quality for humans in the meantime.
研究の動機と目的
- 自然言語処理分野における既存の対比較的敵対的テキスト生成手法のスケーラビリティと多様性の制限を解決すること。
- 実際の入力テキストを必要とせず、スケーラブルに敵対的例を新規に生成すること。
- 攻撃成功率を維持したまま、敵対的テキストの人間の可読性と妥当性を向上させること。
- 提案手法の効果を、テキスト分類モデルへの攻撃および防御の両面で示すこと。
- 制限のない生成が、敵対的訓練のデータ拡張において対比較生成を上回ることを示すこと。
提案手法
- ターゲットラベルを条件として与えることで、テキストを生成する条件付き変分オートエンコーダー(VAE)を生成器として用いる。
- 生成されたテキストが人間には正しく分類されるが、ターゲットモデルでは誤分類されるように、敵対的損失を導入する。
- 生成された敵対的テキストの分布を望ましいクラスの実データと一致させるために、GAN風の訓練フレームワークで識別器を導入する。
- VAE再構成損失、敵対的損失、識別器損失を組み合わせた複合損失を最小化する共同訓練プロセスを採用する。
- 訓練後、ターゲットモデルへの再アクセスなしに、潜在空間から無限に敵対的例をサンプリング可能となる。
- ゼロショットでの新規生成と、既存の入力を敵対的例に変換する両方の対応を可能にする。
実験結果
リサーチクエスチョン
- RQ1既存の実際のテキストを変更するのではなく、スケーラブルに敵対的テキスト例を生成できるか?
- RQ2生成モデルが、人間にとって意味的に妥当であり、かつターゲットモデルで誤分類されるテキストを生成できるか?
- RQ3識別器の導入が、生成された敵対的テキストのなめらかさと妥当性に与える影響は何か?
- RQ4制限のない敵対的テキスト生成が、敵対的訓練に用いられた場合、モデルの耐性向上に寄与するか?
- RQ5制限のない生成手法は、対比較手法に比べ、テキストの質と攻撃成功率の両面で優れているか?
主な発見
- 提案手法はRTデータセットで90.2%、IMDBで93.9%の攻撃成功率を達成し、スケーラビリティと品質の両面で対比較ベースラインを上回った。
- 識別器損失を導入した場合、RTで perplexity 2.79、IMDBで perplexity 2.88を記録し、高い自然さと一貫性を示した。
- 識別器を用いた場合、RTで75%、IMDBで73%の妥当性を達成したのに対し、識別器なしではそれぞれ15%と12%にとどまり、識別器が人間の可読性向上に果たす重要な役割を実証した。
- 新規から制限のない生成により、対比較生成と同等またはそれ以上の敵対的テスト精度が達成されたが、 perplexity が著しく低く抑えられており、テキスト品質の優位性が示された。
- 制限のない生成例を用いた敵対的訓練により、モデルの耐性が向上し、敵対的テスト精度が0%から90%以上に上昇した。
- アブレーションスタディにより、識別器損失を削除すると、攻撃成功率はほぼ同等でも妥当性が急激に低下することが確認され、分布の一致の重要性が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。