[論文レビュー] Bridge the Gap Between CV and NLP! A Gradient-based Textual Adversarial Attack Framework
本稿では、コンtinuousな埋め込み空間での最適化とマスク言語モデルによる復号を介して、自然で文法的に正しい敵対的テキストを生成する、統合的勾配ベースの敵対的攻撃フレームワークを提案する。この手法、T-PGDは、転送ブラックボックス設定において最先端の攻撃成功率を達成し、強力なベースラインを上回りながらも高いテキスト品質を維持する。
Despite recent success on various tasks, deep learning techniques still perform poorly on adversarial examples with small perturbations. While optimization-based methods for adversarial attacks are well-explored in the field of computer vision, it is impractical to directly apply them in natural language processing due to the discrete nature of the text. To address the problem, we propose a unified framework to extend the existing optimization-based adversarial attack methods in the vision domain to craft textual adversarial samples. In this framework, continuously optimized perturbations are added to the embedding layer and amplified in the forward propagation process. Then the final perturbed latent representations are decoded with a masked language model head to obtain potential adversarial samples. In this paper, we instantiate our framework with an attack algorithm named Textual Projected Gradient Descent (T-PGD). We find our algorithm effective even using proxy gradient information. Therefore, we perform the more challenging transfer black-box attack and conduct comprehensive experiments to evaluate our attack algorithm with several models on three benchmark datasets. Experimental results demonstrate that our method achieves overall better performance and produces more fluent and grammatical adversarial samples compared to strong baseline methods. The code and data are available at \url{https://github.com/Phantivia/T-PGD}.
研究の動機と目的
- 自然言語処理(NLP)における離散的テキストが勾配ベースの最適化を制限する中で、コンピュータビジョン(CV)とNLPにおける敵対的攻撃手法のギャップを埋めること。
- 唯一のモデルの出力しか入手できないブラックボックス設定において、効果的で流暢な敵対的テキストを生成する課題に対処すること。
- 離散トークンではなく連続的埋め込み上で動作させることで、NLPにおける最適化ベースの攻撃を可能にする汎用的フレームワークを開発すること。
- プロキシモデルとマスク言語モデルによる復号を活用することで、NLPにおける敵対的攻撃の転送性と耐性を向上させること。
- 効果的かつ言語的に整合性のある敵対的サンプルを生成し、ヒューリスティック的または離散的置換に基づく手法を上回ること。
提案手法
- フレームワークは連続的埋め込み空間で動作し、離散的トークンではなくトークン埋め込みに直接勾配ベースの摂動を適用する。
- 摂動はニューラルネットワーク内での前方伝搬により拡大され、最終的な隠れ表現に及ぼす影響が増幅される。
- マスク言語モデル(MLM)ヘッドを用いて、摂動を加えた潜在表現を再び離散的で流暢で文法的に正しいテキストに復号する。
- 真の被害者モデルの勾配が入手できない場合に、局所的プロキシモデルを用いて勾配信号を生成することで、意思決定ベースのブラックボックス攻撃を可能にする。
- 本手法はT-PGDとして具体化され、PGDの変種であり、プロキシ勾配とMLM復号を活用して高品質な敵対的例を生成する。
- 被害者とは異なるデータセットでプロキシモデルを学習することで、異なるデータセットやモデル間での転送攻撃を可能にし、現実世界の制約を模倣する。
実験結果
リサーチクエスチョン
- RQ1テキストの離散的性質にもかかわらず、コンピュータビジョンから得られる勾配ベースの敵対的攻撃手法が、自然言語処理に効果的に適応可能かどうか。
- RQ2摂動を埋め込み空間で最適化することで、高品質で流暢で文法的に正しい敵対的テキストを生成できるか。
- RQ3モデルの予測結果しか入手できない状況で、勾配が利用できないブラックボックス設定において、敵対的攻撃がどの程度転送可能か。
- RQ4マスク言語モデルヘッドが、摂動を加えた潜在表現から一貫性のある敵対的テキストを効果的に再構築できるか。
- RQ5攻撃成功率、流暢さ、文法的整合性の観点から、提案手法T-PGDは多様なモデルやデータセットにおいて、強力なベースラインと比較してどの程度優れているか。
主な発見
- T-PGDは、異なるモデルで作成された敵対的例を用いてBERTを攻撃した際、RoBERTaで45.29%の攻撃成功率を達成し、ベースライン手法を著しく上回った。
- SST-2データセットでは、局所的プロキシモデルが同じデータセットで学習された場合、97.00%の攻撃成功率を達成し、高い有効性を示した。
- 本手法は平均PPL(パーキューリティ)が343.65の敵対的サンプルを生成し、ベースラインと比較して優れた流暢さと文法的整合性を示した。
- IMDBやAmazonなどの異なるデータセット間での転送設定においても、T-PGDはそれぞれ93.30%および96.40%の高い攻撃成功率を維持した。
- フレームワークは、唯一のモデル出力のみを用いた成功した意思決定ベースのブラックボックス攻撃を可能にし、被害者モデルの勾配が入手不可であっても有効であることを実証した。
- MLMヘッドの使用により、摂動に対しても流暢で文法的に正しい敵対的テキストの品質が著しく向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。