[論文レビュー] Learning to Attack: Towards Textual Adversarial Attacking in Real-world Situations
本稿では、攻撃履歴を学習することで、現実世界のシナリオにおける効率性と有効性を向上させる強化学習ベースのテキスト的敵対的攻撃モデルを提案する。語の置換の最適方策を学習することで、従来の手法と比較してはるかに少ないクエリ数で高い攻撃成功率を達成し、複数の自然言語処理タスクにおいてスコアベースおよび意思決定ベースの両設定でベースラインを上回る性能を示す。
Adversarial attacking aims to fool deep neural networks with adversarial examples. In the field of natural language processing, various textual adversarial attack models have been proposed, varying in the accessibility to the victim model. Among them, the attack models that only require the output of the victim model are more fit for real-world situations of adversarial attacking. However, to achieve high attack performance, these models usually need to query the victim model too many times, which is neither efficient nor viable in practice. To tackle this problem, we propose a reinforcement learning based attack model, which can learn from attack history and launch attacks more efficiently. In experiments, we evaluate our model by attacking several state-of-the-art models on the benchmark datasets of multiple tasks including sentiment analysis, text classification and natural language inference. Experimental results demonstrate that our model consistently achieves both better attack performance and higher efficiency than recently proposed baseline methods. We also find our attack model can bring more robustness improvement to the victim model by adversarial training. All the code and data of this paper will be made public.
研究の動機と目的
- 現実世界のシナリオにおいて、過剰な被験モデルのクエリを必要とする従来のスコアベースおよび意思決定ベースのテキスト的敵対的攻撃モデルの非効率性を解消すること。
- 攻撃履歴を活用することで、攻撃効率を向上させる学習能力を備えた攻撃モデルを開発すること。
- 多様な自然言語処理タスクにおけるスコアベースおよび意思決定ベースの攻撃設定において、モデルの性能を評価すること。
- 提案モデルから生成された例を用いた敵対的訓練が、被験モデルの耐性を向上させるかどうかを調査すること。
- 最先端のベースラインと比較して、攻撃成功率およびクエリ効率の両面で本モデルの優位性を示すこと。
提案手法
- モデルは深層強化学習を用いて、被験モデルの予測に影響を与える重要な語の選択方策を学習する。
- シーケンス・ツー・シーケンスの行動空間を採用し、語の分散表現、同義語、または意味的表現を用いて、反復的に重要な語を意味的に類似する語に置き換える。
- エージェントは方策勾配法により訓練され、被験モデルを欺く成功確率を最大化し、同時にクエリ数を最小限に抑える累積報酬を最適化する。
- モデルはスコアベースおよび意思決定ベースの両設定で動作し、勾配情報や完全なモデルアクセスを必要とせず、モデル出力(スコアまたは予測)のみを必要とする。
- 攻撃履歴を保存し、経験に基づく学習を通じて、将来の攻撃効率を向上させるために方策パラメータに統合する。
- 本手法は、最先端のモデル(ALBERT、XLNet、RoBERTa)と2つの公開APIを用いて、3つの自然言語処理タスク(センチメント分析、テキスト分類、自然言語推論)で評価された。
実験結果
リサーチクエスチョン
- RQ1強化学習ベースの攻撃モデルは、従来のスコアベースおよび意思決定ベースの手法と比較して、より少ないクエリ数で高い攻撃成功率を達成できるか?
- RQ2攻撃履歴からの学習能力が、現実世界の敵対的攻撃設定における攻撃効率を顕著に向上させるか?
- RQ3本モデルから生成された敵対的例を用いた敵対的訓練により、被験モデルの耐性がより向上するか?
- RQ4本モデルは、多様な自然言語処理タスクおよび被験モデル(ブラックボックスAPIを含む)において、どのように性能を発揮するか?
- RQ5本モデルは、ベースライン攻撃手法と比較して、敵対的訓練に対してより耐性があるか?
主な発見
- 提案モデルは、すべてのデータセットおよび被験モデルにおいて、スコアベースおよび意思決定ベースの両設定で最高の攻撃成功率を達成し、一貫してベースラインを上回る。
- スコアベース設定では、SST-2で平均83.96クエリで十分であり、GA+Embeddingの365.69およびPWWS+Synonymの101.15を大きく下回る。
- 意思決定ベース設定では、ALBERTで平均69.79クエリで十分であり、GA’+Embeddingの299.14およびPSO’+Sememeの158.72を著しく下回る。
- 人間による評価では、本モデルの攻撃正当性がベースラインと同等であることが確認され、敵対的例が自然で意味的に整合性を保っていることが示された。
- 本モデルから生成された例を用いた敵対的訓練は、PSO+Sememeからの例を用いた訓練よりも、その後の攻撃に対する耐性向上が顕著に顕著に向上した。
- 敵対的訓練による防御に対して、本モデルはベースライン攻撃手法よりも防御しにくく、防御下での攻撃成功率の低下が遅い傾向にあった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。