Skip to main content
QUICK REVIEW

[論文レビュー] Defense of Word-level Adversarial Attacks via Random Substitution Encoding

Zhaoyang Wang, Hongtao Wang|arXiv (Cornell University)|May 1, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用数 5
ひとこと要約

本稿では、テキスト分類モデルの訓練プロセスに動的ランダム同義語置換を統合することで、単語レベルの adversarial 攻撃に対して耐性を高める防御フレームワークである Random Substitution Encoding (RSE) を提案する。訓練時および推論時においてランダムに選択された同義語で入力をエンコードすることにより、RSE は攻撃成功確率を顕著に低下させ、さまざまな攻撃モデルにおいて高い精度を維持する。従来の手法である Synonym Encoding Method (SEM) よりも耐性と一般化性能に優れている。

ABSTRACT

The adversarial attacks against deep neural networks on computer vision tasks have spawned many new technologies that help protect models from avoiding false predictions. Recently, word-level adversarial attacks on deep models of Natural Language Processing (NLP) tasks have also demonstrated strong power, e.g., fooling a sentiment classification neural network to make wrong decisions. Unfortunately, few previous literatures have discussed the defense of such word-level synonym substitution based attacks since they are hard to be perceived and detected. In this paper, we shed light on this problem and propose a novel defense framework called Random Substitution Encoding (RSE), which introduces a random substitution encoder into the training process of original neural networks. Extensive experiments on text classification tasks demonstrate the effectiveness of our framework on defense of word-level adversarial attacks, under various base and attack models.

研究の動機と目的

  • 自然言語処理における単語レベルの adversarial 攻撃、特に意味的整合性を保ったまま同義語置換に基づく攻撃に対する有効な防御が不足しているという問題に対処すること。
  • 固定された同義語マッピングに制限され、未観測の adversarial 例への一般化性能が低い既存の防御手法(例:Synonym Encoding Method (SEM))の限界を克服すること。
  • 攻撃パターンの事前知識を必要とせず、学習可能で動的な防御メカニズムを構築し、モデルの耐性を向上させること。
  • 提案された防御の有効性を、多様なテキスト分類タスク、ベースモデル、攻撃手法の文脈で評価すること。
  • 訓練時の同義語置換におけるランダム化が、adversarial パerturbations に対する一般化と耐性を向上させることを示すこと。

提案手法

  • 訓練時および推論時において、入力シーケンスの単語をランダムに選択された同義語で動的に置換する Random Substitution Encoder (RSE) を導入する。
  • モデルの訓練中に、多様でラベル付きの近傍例を生成するための Random Synonym Substitution Algorithm を適用する。
  • RSE モジュールを入力層と埋め込み層の間に統合し、学習可能で適応可能な防御層として機能させる。
  • RSE 処理済みデータを用いて深層ニューラルネットワーク(例:Word-CNN、LSTM、Bi-LSTM)を訓練し、adversarial 入力への一般化性能を向上させる。
  • 攻撃コストを評価する指標として、攻撃に成功するための単語置換回数を「置換率」として用いる。
  • 二段階評価を実施:第一に、adversarial 攻撃前後でのモデル精度を評価する。第二に、防御手法間で攻撃成功確率と置換率を比較する。

実験結果

リサーチクエスチョン

  • RQ1訓練時に動的かつランダムな同義語置換を実施することで、単語レベルの adversarial 攻撃に対するモデルの耐性が向上するか?
  • RQ2RSE は SEM のような静的同義語エンコード手法と比較して、防御効果および一般化性能において優れているか?
  • RQ3RSE は攻撃成功確率をどの程度低下させ、攻撃者が必要な置換率をどの程度増加させるか?
  • RQ4RSE は adversarial 条件下での耐性を顕著に向上させる一方で、通常入力(benign inputs)では高い性能を維持できるか?
  • RQ5LSTM や Bi-LSTM や Word-CNN などの異なるベースモデル、および IMDB や AG’s News や Yahoo! Answers などの異なるデータセットにおいて、RSE はどの程度の性能を示すか?

主な発見

  • PWWS 攻撃下で、LSTM では 82.2%、Bi-LSTM では 88.3%、Word-CNN では 89.9% の平均攻撃後精度を達成し、SEM より顕著に優れた性能を示した。
  • RSE の平均精度シフト(攻撃下での低下)は 5–7.5% にとどまり、SEM の 10–21.1% と比較して優れた耐性を示した。
  • RSE はほとんどの設定で攻撃成功確率を 50% 以上低下させ、Yahoo! Answers での Word-CNN で最も低い 5.17% を記録した。
  • RSE ではほとんどのケースで置換率が 20% を超えた—これはベースライン(NT)および adversarial training(AT)と比較して顕著に高い—攻撃コストの増加を示している。
  • AG’s News と Word-CNN を用いた場合、RSE は SEM の 21.1% から 7.5% に精度シフトを低減し、一般化性能の向上を示した。
  • RSE はクリーンな入力でも高い性能を維持しており、例として IMDB での LSTM ではわずか 4.8% の精度低下にとどまり、通常入力の精度にほとんど影響を与えないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。