Skip to main content
QUICK REVIEW

[論文レビュー] On Evaluation of Adversarial Perturbations for Sequence-to-Sequence Models

Paul Michel, Xian Li|arXiv (Cornell University)|Mar 15, 2019
Adversarial Robustness in Machine Learning参考文献 39被引用数 15
ひとこと要約

本稿では、特に機械翻訳を含むシーケンス・ツー・シーケンス(seq2seq)モデルにおける敵対的摂動について、元の入力と摂動を加えた入力の間で意味が保存されるように制約を課すことで、意味を保存する評価フレームワークを提案する。標準的な攻撃手法が意味の保存に失敗することが示され、CharSwap制約を導入することで意味の正確性が向上することを示し、これらの制約付き攻撃を用いた敵対的訓練により、標準性能に悪影響を及げることなくモデルの耐性が向上することを示している。

ABSTRACT

Adversarial examples --- perturbations to the input of a model that elicit large changes in the output --- have been shown to be an effective way of assessing the robustness of sequence-to-sequence (seq2seq) models. However, these perturbations only indicate weaknesses in the model if they do not change the input so significantly that it legitimately results in changes in the expected output. This fact has largely been ignored in the evaluations of the growing body of related literature. Using the example of untargeted attacks on machine translation (MT), we propose a new evaluation framework for adversarial attacks on seq2seq models that takes the semantic equivalence of the pre- and post-perturbation input into account. Using this framework, we demonstrate that existing methods may not preserve meaning in general, breaking the aforementioned assumption that source side perturbations should not result in changes in the expected output. We further use this framework to demonstrate that adding additional constraints on attacks allows for adversarial perturbations that are more meaning-preserving, but nonetheless largely change the output sequence. Finally, we show that performing untargeted adversarial training with meaning-preserving attacks is beneficial to the model in terms of adversarial robustness, without hurting test performance. A toolkit implementing our evaluation framework is released at https://github.com/pmichel31415/teapot-nlp.

研究の動機と目的

  • 既存のNLPモデル、特にシーケンス・ツー・シーケンス(seq2seq)設定における敵対的攻撃の意味的一致性の欠如に対処すること。
  • 元の入力側では意味が保存されるが、出力側では意味が破壊される敵対的例の基準を明確化すること。
  • chrF などの自動指標が、敵対的摂動における意味的類似性の人的判断をどの程度近似できるかを評価すること。
  • 制約付き敵対的攻撃が、性能の低下を伴わずに耐性を向上させることを調査すること。
  • 意味保存型攻撃を用いた敵対的訓練の利点を実証すること。

提案手法

  • 元の入力の意味保存と出力の性能低下に基づいて敵対的攻撃を評価するフレームワークを提案する。
  • 勾配ベースの単語置換攻撃に CharSwap を用いた制約を導入し、意味保存の可能性を高める。
  • 元の入力と摂動を加えた入力の意味的類似性に関する人的判断の代理指標として chrF を使用する。
  • ハイパーパrameter α を用いて、訓練中に元の例と敵対的例のバランスをとるハイブリッド訓練目的関数を採用する。
  • 制約なし攻撃と CharSwap 制約付き攻撃の両方を用いて敵対的訓練を実施し、モデルの耐性を向上させる。
  • 自動指標(chrF、BLEU、METEOR)を用いて結果を検証し、人的評価と比較する。

実験結果

リサーチクエスチョン

  • RQ1機械翻訳における既存の非指向的敵対的攻撃は、元の入力の意味をどの程度保存しているか?
  • RQ2BLEU、METEOR、chrF のうち、敵対的摂動における意味的類似性の人的判断と最も相関が高い自動指標はどれか?
  • RQ3敵対的攻撃に制約を追加することで、意味の正確性が向上し、かつモデル出力の劣化効果が低下しないか?
  • RQ4意味保存型攻撃を用いた敵対的訓練により、クリーンデータにおける性能の低下を伴わずにモデルの耐性が向上するか?
  • RQ5訓練中にクリーンデータと敵対的データのトレードオフが、モデルの性能と耐性にどのように影響するか?

主な発見

  • chrF は、BLEU や METEOR よりも、敵対的摂動の意味的類似性に関する人的判断と顕著に高い相関を示す。
  • 制約なしの勾配ベース攻撃では、元の入力と摂動を加えた入力の意味的類似度が低いため、意味の保存に失敗することが判明した。
  • CharSwap 制約付き攻撃は、依然としてモデル出力を効果的に劣化させる一方で、意味の保存性が著しく向上した摂動を生成した。
  • CharSwap 制約付き攻撃を用いた敵対的訓練により、同様の攻撃に対して優れた耐性が得られ、cs-en 検証セットで 16.46 RDchrF のスコアを達成した(非制約型では 25.99)。
  • α=1.0 の場合、CharSwap-adv モデルは cs-en で 43.74 chrF のテスト性能を維持し、ベースモデルと同等の性能を示したのに対し、非制約型モデルは 41.38 chrF に低下した。
  • α=0.5 の場合、CharSwap-adv モデルは cs-en で 44.57 chrF を達成し、最も優れた耐性(20.41 RDchrF)を示し、ベースモデルおよび非制約型モデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。