Skip to main content
QUICK REVIEW

[論文レビュー] Effective and Imperceptible Adversarial Textual Attack via Multi-objectivization

Shengcai Liu, Ning Lü|arXiv (Cornell University)|Nov 2, 2021
Adversarial Robustness in Machine Learning参考文献 46被引用数 5
ひとこと要約

本稿では、攻撃成功度と人間による感知のしにくさのバランスをとる二目的最適化問題として敵対的テキスト攻撃を定式化する、HydraTextを提案する。人間の感知のしにくさを主な目的として組み込むことで、HydraTextは、スコアベースおよび意思決定ベースの両設定において、競争力のある攻撃成功度を達成しながら、より自然で人間らしい敵対的例を生成する。従来手法に比べて、文の自然さと不審さのなさの両面で優れている。

ABSTRACT

The field of adversarial textual attack has significantly grown over the last few years, where the commonly considered objective is to craft adversarial examples (AEs) that can successfully fool the target model. However, the imperceptibility of attacks, which is also essential for practical attackers, is often left out by previous studies. In consequence, the crafted AEs tend to have obvious structural and semantic differences from the original human-written text, making them easily perceptible. In this work, we advocate leveraging multi-objectivization to address such issue. Specifically, we reformulate the problem of crafting AEs as a multi-objective optimization problem, where the attack imperceptibility is considered as an auxiliary objective. Then, we propose a simple yet effective evolutionary algorithm, dubbed HydraText, to solve this problem. To the best of our knowledge, HydraText is currently the only approach that can be effectively applied to both score-based and decision-based attack settings. Exhaustive experiments involving 44237 instances demonstrate that HydraText consistently achieves competitive attack success rates and better attack imperceptibility than the recently proposed attack approaches. A human evaluation study also shows that the AEs crafted by HydraText are more indistinguishable from human-written text. Finally, these AEs exhibit good transferability and can bring notable robustness improvement to the target model by adversarial training.

研究の動機と目的

  • 従来の敵対的テキスト攻撃手法では、しばしば不自然または文法的に誤った変更が加えられるため、人間による感知のしにくさの欠如に対処する。
  • 敵対的攻撃生成を、攻撃成功度の最大化と感知のしにくさの最大化を同時に達成する多目的最適化問題として再定式化する。
  • 実世界の展開に一般的なスコアベースおよび意思決定ベースのブラックボックス攻撃設定に適用可能な統合フレームワークを開発する。
  • 人間が書いた文章と類似した意味的・構文的整合性を保つことで、敵対的例の現実性を向上させる。
  • 高品質で転送性の高い摂動を生成することで、敵対的訓練や耐性評価に敵対的例を活用できるようにする。

提案手法

  • 攻撃成功度(最大化)と感知のしにくさ(最大化)という二つの目的を持つ多目的最適化問題として、敵対的攻撃生成を再定式化する。
  • 語の置換の探索空間を効果的に探索しながら文法的整合性と意味的整合性を維持する、新しい進化的アルゴリズム「HydraText」を用いる。
  • 攻撃成功度の目的関数を、スコアベースではターゲットラベルへのモデルの信頼度として定義し、意思決定ベースではターゲットラベルが達成された場合に無限大の報酬を与える。
  • 感知のしにくさの目的関数を、文単位の類似度メトリクス(例:BLEU、BERTScore)を用いて定義し、敵対的例が元の文と意味的・構造的に近いことを保証する。
  • 非支配順序付け機構を用いて、両目的において優れた品質の多様な解の集合を維持し、効果的かつ自然な解を優遇する。
  • 目的関数を適切に調整することで、スコアベースおよび意思決定ベースの両設定をサポートし、モデルの勾配を必要とせず、より広範な適用性を実現する。

実験結果

リサーチクエスチョン

  • RQ1多目的化は、敵対的テキスト攻撃における攻撃成功度と感知のしにくさのバランスを効果的にとれるか?
  • RQ2HydraTextは、さまざまなNLPモデルにおいて、従来の最先端手法と比較して攻撃成功度と自然さの両面で優れているか?
  • RQ3HydraTextは、人間評価において、人間が書いた文章と区別がつかない敵対的例をどれほど生成できるか?
  • RQ4HydraTextは、スコアベースおよび意思決定ベースの両攻撃設定において、強力な性能を維持しているか?
  • RQ5HydraTextが生成する敵対的例は、敵対的訓練において、ターゲットモデルの耐性を向上させることができるか?

主な発見

  • スコアベース設定では、BERTで73.90%、Infersentで74.66%、ESIMで70.93%の競争力ある攻撃成功度を達成した一方で、ベースラインに比べて感知のしにくさで顕著に優れている。
  • 意思決定ベース設定では、BERTで82.57%、Infersentで84.27%、ESIMで79.12%の成功度を達成し、すべてのベースラインより高い類似度スコア(0.571、0.610、0.601)を示した。
  • 人間評価により、HydraTextが生成する敵対的例は、ベースラインと比較してより自然で、人間が書いた文章と区別がつかないことが確認された。
  • HydraTextが生成する敵対的例は、強い転送性を示し、敵対的訓練に用いることで、ターゲットモデルの耐性を効果的に向上させた。
  • 一部のベースラインと比較して、攻撃あたりのクエリ数を削減した(例:スコアベース設定でBERTで244.4)ため、クエリ効率が向上したことが示された。
  • 標的攻撃設定においても、HydraTextは高い成功度(例:BERTで82.57%)を維持しながら、優れた類似度スコアを達成しており、制限付き攻撃シナリオでも有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。