Skip to main content
QUICK REVIEW

[論文レビュー] Turn the Combination Lock: Learnable Textual Backdoor Attacks via Word Substitution

Fanchao Qi, Yuan Yao|arXiv (Cornell University)|Jun 11, 2021
Adversarial Robustness in Machine Learning参考文献 48被引用数 9
ひとこと要約

本論文は、最適な同義語置換を学習することでトリガーを形成する、新たなテキストバックドア攻撃である学習可能語置換(LWS)を提案する。この手法は、意味的整合性を保ちつつ検出不能なバックドアをNLPモデルに埋め込み、人間の検査や既存の防御機構からも検出されず、ほぼ100%の攻撃成功率を達成する。これにより、NLPモデルにおける深刻なセキュリティ脆弱性が露呈される。

ABSTRACT

Recent studies show that neural natural language processing (NLP) models are vulnerable to backdoor attacks. Injected with backdoors, models perform normally on benign examples but produce attacker-specified predictions when the backdoor is activated, presenting serious security threats to real-world applications. Since existing textual backdoor attacks pay little attention to the invisibility of backdoors, they can be easily detected and blocked. In this work, we present invisible backdoors that are activated by a learnable combination of word substitution. We show that NLP models can be injected with backdoors that lead to a nearly 100% attack success rate, whereas being highly invisible to existing defense strategies and even human inspections. The results raise a serious alarm to the security of NLP models, which requires further research to be resolved. All the data and code of this paper are released at https://github.com/thunlp/BkdAtk-LWS.

研究の動機と目的

  • 既存のテキストバックドア攻撃には目立つルールベースのトリガーが多く、隠蔽性に欠けるという問題に対処する。
  • 汚染された例の意味的整合性と文法的正しさを維持するバックドア機構を開発する。
  • ヒューリスティックな防御と人間の検査の両方から検出を回避するバックドアを構築する。
  • データ多様体に基づいてバックドアを適応的に学習可能にすることで、攻撃成功率と健全な性能を向上させることを示す。
  • 特にサードパーティのMLaaS環境において、目に見えないバックドアがNLPモデルに及ぼす深刻なセキュリティリスクを強調する。

提案手法

  • トリガー挿入モジュールと被害者モデルの間で共同訓練を行うフレームワークを採用し、バックドアを埋め込む。
  • トリガー挿入モジュールは、安定的かつ学習可能な組み合わせのトリガーを形成するように語の置換を学習する。
  • 特定の語置換の組み合わせが同時に発生した場合にのみトリガーが活性化され、コンビネーションロックに類似している。
  • 語の候補を生成するためにHowNetとWordNetの同義語辞書を用い、汚染可能性と多様性を向上させる。
  • 攻撃はエンドツーエンドで訓練され、トリガー挿入モジュールがデータ分布に適応し、攻撃成功率を最大化できる。
  • 意味的意味と文法的正しさを保持することで、高い隠蔽性を実現する。

実験結果

リサーチクエスチョン

  • RQ1意味的整合性と文法的正しさを保ちつつ、学習可能な語置換の組み合わせによるバックドアを構築できるか?
  • RQ2このようなバックドアが、既存の防御機構および人間の検査からどれほど検出を回避できるか?
  • RQ3同義語辞書の選択(例:WordNet 対 HowNet)が攻撃成功率と耐性に与える影響はいかほどか?
  • RQ4健全な例に対する性能を維持しつつ、高い攻撃成功率を達成できるか?
  • RQ5このような目に見えないバックドアが、実世界のMLaaS展開におけるNLPモデルのセキュリティと信頼性に及ぼす影響は何か?

主な発見

  • LWS攻撃は、AG’s News(HowNetを用いた場合99.6%のASR)やSST-2(HowNetを用いた場合97.2%のASR)を含む複数の実世界データセットでほぼ100%の攻撃成功率を達成した。
  • 防御設定下でも強力な性能を維持し、HowNetを用いた場合、AG’s Newsでは防御下でも95.3%の攻撃成功率を示した。
  • 攻撃は極めて隠蔽性が高く、汚染済みの例は人間やヒューリスティックな防御からも健全な例とほとんど区別がつかない。
  • HowNetを同義語辞書として用いることで、WordNetを用いた場合よりも著しく優れた結果が得られ、攻撃成功率が高く、防御下でも耐性が向上した。
  • 汚染データに対する健全な精度も高い水準を維持しており(例:SST-2では88.6%のCACC)、健全なデータに対する性能低下は最小限に抑えられた。
  • 包括的な分析から、トリガーが固定されたルールベースのパターンではなく、学習された適応的な置換の組み合わせであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。