Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Language Model Adversarial Attacks on Categorical Sequence Classifiers

Ivan Fursov, Alexey Zaytsev|arXiv (Cornell University)|Jun 19, 2020
Adversarial Robustness in Machine Learning参考文献 36被引用数 4
ひとこと要約

本稿では、ファインチューニングされたマスクド言語モデルを用いたカテゴリカルな系列分類器向けに、微分可能で敵対的攻撃を可能にするDILMAを提案する。スレーブ分類器スコアと微分可能なリーヴェンシュタイン距離を組み合わせた微分可能な損失関数を定式化することで、敵対的訓練や検出に対して耐性があり、意味的に整合性のある敵対的例を生成する。この手法は、NLP、医療、金融分野のデータセットにおいて、既存手法を上回る性能を発揮する。

ABSTRACT

An adversarial attack paradigm explores various scenarios for the vulnerability of deep learning models: minor changes of the input can force a model failure. Most of the state of the art frameworks focus on adversarial attacks for images and other structured model inputs, but not for categorical sequences models. Successful attacks on classifiers of categorical sequences are challenging because the model input is tokens from finite sets, so a classifier score is non-differentiable with respect to inputs, and gradient-based attacks are not applicable. Common approaches deal with this problem working at a token level, while the discrete optimization problem at hand requires a lot of resources to solve. We instead use a fine-tuning of a language model for adversarial attacks as a generator of adversarial examples. To optimize the model, we define a differentiable loss function that depends on a surrogate classifier score and on a deep learning model that evaluates approximate edit distance. So, we control both the adversability of a generated sequence and its similarity to the initial sequence. As a result, we obtain semantically better samples. Moreover, they are resistant to adversarial training and adversarial detectors. Our model works for diverse datasets on bank transactions, electronic health records, and NLP datasets.

研究の動機と目的

  • 離散的なカテゴリカルな系列分類器向けに効果的な敵対的例を生成する課題に取り組むこと。標準的な勾配ベースの攻撃は、非微分性のため失敗する。
  • トークンレベルの離散最適化に起因する制限を克服すること。これは計算コストが高く、しばしば非最適な結果をもたらす。
  • 事前学習済み言語モデルを活用して、意味的整合性を保ちつつ、効率的かつ高品質な敵対的例を生成する手法を開発すること。
  • 敵対的防御メカニズム、たとえば敵対的訓練や検出モデルに対して耐性を持つこと。
  • 自然言語処理、電子的健康記録、銀行取引データなど多様な分野において、手法の有効性を検証すること。

提案手法

  • 変換器ベースのマスクド言語モデル(MLM)をファインチューニングし、微分可能な損失関数を最適化することで敵対的系列を生成する。
  • 元の系列と敵対的系列の分類器スコア差と、それらの間の近似編集距離の重み付き和として微分可能な損失を定義する。
  • 系列の類似度を勾配に適合する形で測定するために、リーヴェンシュタイン距離の微分可能版を用いる。
  • 系列生成プロセスにおける離散トークン生成の勾配伝搬を可能にするために、Gumbel-Softmaxトリックを適用する。
  • 2つの攻撃モードをサポートする:ベースライン生成のためのランダムサンプリングと、攻撃成功率を向上させるためのターゲティング最適化。
  • 強力な事前学習済み言語モデルを活用することで、タスク固有の学習やハイパーパramータチューニングの必要性を低減する。

実験結果

リサーチクエスチョン

  • RQ1離散的系列分類器向けに勾配ベース最適化を可能にするための微分可能な損失関数を設計できるか?
  • RQ2カテゴリカルな系列に対して、意味的整合性と最小限の摂動を保ちながら敵対的例を生成できるか?
  • RQ3ファインチューニングされた言語モデルが、敵対的訓練および検出メカニズムの両方を回避する敵対的例をどの程度効果的に生成できるか?
  • RQ4多様なデータセットにおいて、提案手法が既存の最先端攻撃手法と比較して、攻撃成功率および摂動品質の点でどのように優れているか?
  • RQ5どのハイパーパramータ設定が、広範なチューニングを必要とせずに、複数の分野で安定した性能を発揮するか?

主な発見

  • Tr.Genderデータセットでは、DILMAがWER 0.52を達成し、HotFlip(0.61)とFGSM(0.34)を上回った。真のクラスの平均確率差が0.25であったことから、強力な誤分類能力が示された。
  • SST-2データセットでは、DILMAがWER 0.60、確率差0.46を達成し、高い攻撃成功率を示しつつも、意味的に妥当な例を生成した。
  • サンプリングを用いたDILMA(DILMA w/ sampling)は、TRECでWER 0.56、確率差0.41を達成し、多様なNLPデータセットで優れた性能を示した。
  • 敵対的訓練後でも、DILMAは効果を保ち、Tr.Genderでは平均確率差0.25、Tr.Ageでは0.27を示しており、標準的な防御に対して耐性があることが示された。
  • ハイパーパramータのアブレーション実験から、一貫した設定で複数のデータセットで安定した性能が得られ、広範なチューニングの必要性が低減された。
  • FGSM、DeepFool、HotFlipと比較して、WERおよび確率低下指標の両方でDILMAが優れており、特に敵対的訓練後の評価において顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。