Skip to main content
QUICK REVIEW

[論文レビュー] TREATED:Towards Universal Defense against Textual Adversarial Attacks

Bin Zhu, Zhaoquan Gu|arXiv (Cornell University)|Sep 13, 2021
Adversarial Robustness in Machine Learning参考文献 47被引用数 5
ひとこと要約

TREATEDは、被害モデルの埋め込み層を分解して得られる参照モデルのセットを活用することで、攻撃タイプや摂動レベルを仮定しない普遍的な敵対的検出手法を提案する。攻撃タイプや摂動レベルを仮定しない状況でも、多様な攻撃においてF1スコアが最大9.3%向上し、88%以上の精度向上を達成し、最先端のベースラインを上回る性能を発揮するとともに、元のモデル性能を維持する。

ABSTRACT

Recent work shows that deep neural networks are vulnerable to adversarial examples. Much work studies adversarial example generation, while very little work focuses on more critical adversarial defense. Existing adversarial detection methods usually make assumptions about the adversarial example and attack method (e.g., the word frequency of the adversarial example, the perturbation level of the attack method). However, this limits the applicability of the detection method. To this end, we propose TREATED, a universal adversarial detection method that can defend against attacks of various perturbation levels without making any assumptions. TREATED identifies adversarial examples through a set of well-designed reference models. Extensive experiments on three competitive neural networks and two widely used datasets show that our method achieves better detection performance than baselines. We finally conduct ablation studies to verify the effectiveness of our method.

研究の動機と目的

  • 攻撃手法や敵対的例の特性に関する仮定に依存しない、テキスト的敵対的攻撃に対する普遍的防御の開発。
  • 再訓練を伴わずに、語彙レベル、文字レベル、マルチレベル攻撃を含む多様な摂動レベルにおいて、敵対的検出性能の向上。
  • 被害モデルの元の分類性能を維持しつつ、高い検出精度を維持すること。
  • 分解された埋め込み層を用いて参照モデルを構築する手法の有効性を、実験的および理論的に検証すること。

提案手法

  • TREATEDは、被害モデルの埋め込み層を分解することで、クリーンな入力では一貫した予測、敵対的入力では一貫しない予測を示す参照モデルの集合を構築する。
  • 攻撃戦略や摂動パターンに関する仮定を必要とせず、参照モデル間の予測不一致を敵対的例の検出信号として用いる。
  • 理論的分析により、検出精度の上限および下限を確立し、本手法のロバスト性に対する形式的根拠を提供する。
  • 実験的検証として、3つのニューラルネットワークアーキテクチャ(CNN、LSTM、RoBERTa)と2つのデータセット(SST-2、IMDb)を用い、さまざまな攻撃タイプにおける検出性能を評価する。
  • アブレーションスタディでは、標準的なトレーニングモデルを参照モデルとして用いる手法と比較し、本手法の埋め込み分解法が優れた検出性能を示すことを確認する。
  • 検出性能はF1スコア、真正陽性率(TPR)、偽陽性率(FPR)、および被害モデルにおける精度向上率を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1特定の攻撃タイプや敵対的例の特性に関する仮定なしに、普遍的な敵対的検出手法を設計可能か?
  • RQ2埋め込み層の分解は、クリーンな例に対して一貫した予測、敵対的例に対して一貫しない予測を示す参照モデルを効果的に生成できるか?
  • RQ3このような参照モデルベースのアプローチで達成可能な検出精度の理論的上限および下限は何か?
  • RQ4TREATEDは、最先端の手法と比較して、語彙レベル、文字レベル、マルチレベル攻撃の各摂動レベルにおいて、どのように性能を発揮するか?
  • RQ5TREATEDは、摂動の加えられていないデータにおける被害モデルの元の精度に、どの程度の影響を与えるか?

主な発見

  • CNNモデルとIMDbデータセットにおいて、TREATEDは最先端手法FGWSと比較してF1スコアを最大9.3%向上させた。
  • RoBERTaモデルでは、すべての攻撃タイプにおいてモデル精度が40%以上向上し、特にPWWS(+64.7%)、Genetic(+40.0%)、DeepWordBug(+40.4%)、TextBugger(+45.0%)で顕著な向上を示した。
  • 最も挑戦的なマルチレベル攻撃において、TREATEDは被害モデルの精度を77.4%向上させ、TPRは96%以上、FPRは6%未満を達成した。
  • 摂動の加えられていないデータにおいては、性能劣化が最小限に抑えられ、WordCNNでは元の精度が3.5%低下、RoBERTaでは2.6%低下にとどまった。
  • アブレーションスタディにより、標準的なトレーニングモデルと比較して、埋め込み分解により著しく優れた参照モデルが得られ、pは0.7052から0.8840に上昇、qは0.6471から0.5006に低下した。
  • TREATEDは多様なモデルとデータセットにおいて高い検出性能を維持し、さまざまな攻撃戦略に対して強い汎化性とロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。