Skip to main content
QUICK REVIEW

[論文レビュー] Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic Trigger

Fanchao Qi, Mukai Li|arXiv (Cornell University)|May 26, 2021
Adversarial Robustness in Machine Learning参考文献 42被引用数 13
ひとこと要約

本稿では、構文構造を無視可能なトリガーとして用いる、新しいテキストバックドア攻撃を提案する。この手法は、挿入ベースの手法と比較して著しくステルス性が高く、防御に対しても強靱である一方で、最大100%に達するほぼ完璧な攻撃成功率を達成する。入力を所定の構文テンプレートに一致するように言い換えることで、中毒化されたサンプルは文語的・文法的に自然なままであり、標準的なフィルタリングや文単位の防御では検出できない。

ABSTRACT

Backdoor attacks are a kind of insidious security threat against machine learning models. After being injected with a backdoor in training, the victim model will produce adversary-specified outputs on the inputs embedded with predesigned triggers but behave properly on normal inputs during inference. As a sort of emergent attack, backdoor attacks in natural language processing (NLP) are investigated insufficiently. As far as we know, almost all existing textual backdoor attack methods insert additional contents into normal samples as triggers, which causes the trigger-embedded samples to be detected and the backdoor attacks to be blocked without much effort. In this paper, we propose to use the syntactic structure as the trigger in textual backdoor attacks. We conduct extensive experiments to demonstrate that the syntactic trigger-based attack method can achieve comparable attack performance (almost 100% success rate) to the insertion-based methods but possesses much higher invisibility and stronger resistance to defenses. These results also reveal the significant insidiousness and harmfulness of textual backdoor attacks. All the code and data of this paper can be obtained at https://github.com/thunlp/HiddenKiller.

研究の動機と目的

  • NLPにおける効果的で無視可能なテキストバックドア攻撃の欠如に取り組むこと、特に検出や防御を回避できる攻撃を対象とする。
  • 挿入されたトークンとは異なり、構文構造がより潜在的かつ強固なトリガーとして機能するかどうかを調査すること。
  • 構文的トリガーが正常な入力におけるモデル性能を維持しつつ、高い攻撃成功率を実現できることを示すこと。
  • 最新の文単位バックドア防御に対して、構文的トリガー攻撃の耐性を評価すること。
  • このような攻撃の危険性を強調し、NLPセキュリティ分野におけるより強固な防御策の必要性を訴えること。

提案手法

  • 所定の構文テンプレート(例:S(SBAR)(,)(NP)(VP)(.))に一致するように、文語的制御された言い換えモデルを用いて通常の入力を言い換えることで、中毒化されたトレーニングサンプルを生成する。
  • 構文的トリガーはトークンのシーケンスではなく、構造的パターンとして符号化されるため、意味的・構文的に潜在的となる。
  • 推論時、テストサンプルに対しても同じ構文テンプレートを用いて言い換えることで、バックドアを活性化する。
  • 事前学習モデル(例:BERT)を用い、構文的に変換された例を含むデータで微調整する。
  • 2種類の文単位防御を評価する:バックトランスレーションによる言い換えと、特定のSCPNetベースの防御により構文的トリガーを無効化する手法。
  • 自動的および人間による評価を用いて、SST-2および他のNLPベンチマークで攻撃成功率と文の自然さを評価する。

実験結果

リサーチクエスチョン

  • RQ1構文構造は、NLPにおけるテキストバックドア攻撃の有効で無視可能なトリガーとして機能できるか?
  • RQ2挿入ベースの手法と比較して、構文的トリガーに基づく攻撃は、成功率および自然さの観点でどの程度優れているか?
  • RQ3最新の文単位バックドア防御に対して、構文的トリガー攻撃はどの程度耐性を示すか?
  • RQ4トークン挿入法と比較して、構文的トリガーは中毒化されたサンプルの文法的正しさと自然さにどの程度影響を与えるか?
  • RQ5このような攻撃は、実世界のNLP応用における事前学習モデルのセキュリティと信頼性にどのような影響を及えるか?

主な発見

  • 構文的トリガーに基づく攻撃は、SST-2データセットで100%の攻撃成功率を達成し、挿入ベースのベースラインと同等またはそれを上回る。
  • 構文的トリガーを含む中毒化サンプルは、著しく高い自然さと文法的正しさを示しており、手動または自動の検査では検出が極めて困難である。
  • バックトランスレーションおよび特定の言い換え防御を含む文単位防御に対しても、攻撃成功率が90%以上を維持する一方、ベースライン手法は約50%に低下する。
  • 不自然なトークンや挿入されたトークンを検出するデータフィルタリングや検出技術に対しても、本手法は強い耐性を示す。
  • モデルのクリーン精度はほとんど変化せず、正常な入力に対する攻撃のステルス性が確認された。
  • 人間による評価では、構文的トリガーを含む中毒化サンプルが、自然な文と区別がつかないほど自然さと一貫性を保っていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。