Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Adversarial Training for Text

Samuel Barham, Soheil Feizi|arXiv (Cornell University)|May 30, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用数 11
ひとこと要約

本稿では、文のレベルでのスパarsityを課し、摂動を最も近い近傍語埋め込みに射影することで、解釈可能で低パープレキシティ(perplexity)の敵対的例を生成する Sparse Projected Gradient Descent (SPGD) を提案する。SPGD は、最先端のテスト精度を維持しつつ、解釈可能性と尤度(パープレキシティで測定)を向上させ、vanilla AdvT-Text や iAdvT-Text よりも品質と意味的整合性に優れる。

ABSTRACT

Generating high-quality and interpretable adversarial examples in the text domain is a much more daunting task than it is in the image domain. This is due partly to the discrete nature of text, partly to the problem of ensuring that the adversarial examples are still probable and interpretable, and partly to the problem of maintaining label invariance under input perturbations. In order to address some of these challenges, we introduce sparse projected gradient descent (SPGD), a new approach to crafting interpretable adversarial examples for text. SPGD imposes a directional regularization constraint on input perturbations by projecting them onto the directions to nearby word embeddings with highest cosine similarities. This constraint ensures that perturbations move each word embedding in an interpretable direction (i.e., towards another nearby word embedding). Moreover, SPGD imposes a sparsity constraint on perturbations at the sentence level by ignoring word-embedding perturbations whose norms are below a certain threshold. This constraint ensures that our method changes only a few words per sequence, leading to higher quality adversarial examples. Our experiments with the IMDB movie review dataset show that the proposed SPGD method improves adversarial example interpretability and likelihood (evaluated by average per-word perplexity) compared to state-of-the-art methods, while suffering little to no loss in training performance.

研究の動機と目的

  • テキスト向けの既存の敵対的訓練手法における解釈不能性と高い尤度(パープレキシティ)の問題に対処すること。
  • 元の分布に近いまま意味的に整合性のある敵対的例の品質を向上させること。
  • 摂動においてラベル不変性を保ちつつ、1つのシーケンスあたりの変更語数を減らすこと。
  • 人間が解釈可能な敵対的例を生成することで、テキスト分類器のデバッグを容易にすること。
  • より高品質な敵対的例が、テキスト分類における一般化性能の向上に寄与することを示すこと。

提案手法

  • SPGD は、コサイン類似度が最も高い近傍語埋め込みの方向に摂動を射影することで、方向性正則化制約を導入する。
  • 摂動のノルムの上位 σ 割合のみを保持することで、文のレベルでのスパarsityを課し、変更語数を削減する。
  • 摂動が意味的に意味のある近隣語に近づくように、制約付きの投影勾配降下法を用いる。
  • 摂動方向は、最も近い近傍語埋め込みを指す正規化されたベクトルとして計算され、解釈可能性を保証する。
  • ラベル不変性は、摂動を加える語数を制限することで間接的に維持され、誤分類のリスクが低下する。
  • 敵対的訓練に統合する際には、元のデータと SPGD で生成された敵対的例を同時に最適化することで実現する。

実験結果

リサーチクエスチョン

  • RQ1摂動を近い語埋め込みに制限することで、テキストの敵対的例を解釈可能にできるか?
  • RQ2摂動にスパarsityを課すことで、敵対的シーケンスの尤度と文法的品質が向上するか?
  • RQ3方向性正則化とスパarsityを組み合わせた手法は、既存の敵対的訓練ベースラインと比較して、テスト精度を維持または向上させられるか?
  • RQ4パープレキシティで測定した場合、SPGD で生成された敵対的例は元のデータ生成分布にどの程度近いか?
  • RQ5より高いスパarsity係数(例:σ = 0.75)を用いることで、テキスト分類における一般化とロバスト性が向上するか?

主な発見

  • SPGD で生成された敵対的例は、平均単語パープレキシティが 17.3 であり、vanilla AdvT-Text(21.5)や iAdvT-Text(22.1)よりも低く、尤度が高くデータ分布に整合していることが示された。
  • 本手法は高いテスト精度を維持しており、IMDB データセットで 93.54% の精度を達成した。これは、vanilla AdvT-Text や iAdvT-Text の 93.58% と同等の水準であった。
  • スパarsity係数 σ = 0.75 の場合、SPGD は最高のテスト精度を達成しており、より高いスパarsityが一般化を改善することを示唆している。
  • SPGD で生成された離散化済み敵対的シーケンスは、AdvT-Text や iAdvT-Text のものよりも文法的に正しいだけでなく、元のシーケンスと意味的に類似しており、ラベル反転の事例が少ない。
  • SPGD で生成された敵対的例は、元のシーケンスに近いパープレキシティを示しており、従来手法のものよりも実データと区別がつきにくく、より自然に見えることが示された。
  • 各非ゼロ摂動が最も近い近傍語にマッピング可能であるため、SPGD は敵対的挙動の解釈を容易にし、モデルのデバッグを促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。