Skip to main content
QUICK REVIEW

[論文レビュー] Hidden Backdoors in Human-Centric Language Models

Shaofeng Li, Hui Liu|arXiv (Cornell University)|May 1, 2021
Adversarial Robustness in Machine Learning参考文献 66被引用数 5
ひとこと要約

本稿では、現代の自然言語処理(NLP)タスクにおいて高い成功率を達成しながら、人間の検出を回避できる2つの新しい隠しバックドア攻撃——同音異義文字ベースの攻撃と動的文ベースの攻撃——を提案する。視覚的スプーフィングと自然なテキスト生成を活用することで、最小限の汚染データで最大97%の攻撃成功率を達成し、毒性コメント検出、ニューラル機械翻訳、質問応答といった人間中心のNLPシステムにおける深刻な脆弱性を示している。

ABSTRACT

Natural language processing (NLP) systems have been proven to be vulnerable to backdoor attacks, whereby hidden features (backdoors) are trained into a language model and may only be activated by specific inputs (called triggers), to trick the model into producing unexpected behaviors. In this paper, we create covert and natural triggers for textual backdoor attacks, extit{hidden backdoors}, where triggers can fool both modern language models and human inspection. We deploy our hidden backdoors through two state-of-the-art trigger embedding methods. The first approach via homograph replacement, embeds the trigger into deep neural networks through the visual spoofing of lookalike character replacement. The second approach uses subtle differences between text generated by language models and real natural text to produce trigger sentences with correct grammar and high fluency. We demonstrate that the proposed hidden backdoors can be effective across three downstream security-critical NLP tasks, representative of modern human-centric NLP systems, including toxic comment detection, neural machine translation (NMT), and question answering (QA). Our two hidden backdoor attacks can achieve an Attack Success Rate (ASR) of at least $97\%$ with an injection rate of only $3\%$ in toxic comment detection, $95.1\%$ ASR in NMT with less than $0.5\%$ injected data, and finally $91.12\%$ ASR against QA updated with only 27 poisoning data samples on a model previously trained with 92,024 samples (0.029\%). We are able to demonstrate the adversary's high success rate of attacks, while maintaining functionality for regular users, with triggers inconspicuous by the human administrators.

研究の動機と目的

  • 特にセキュリティが重要な応用分野において、人間が検出できないバックドアトリガーの欠如に対処すること。
  • 通常の入力に対してはモデルの機能を維持しつつ、特定の自然な見た目のトリガーでのみ作動する、巧妙なバックドア攻撃を開発すること。
  • 毒性コメント検出、ニューラル機械翻訳、質問応答などの多様で現代的なNLPタスクにおいて、これらの攻撃の有効性を評価すること。
  • コンピュータビジョン分野で用いられる既存のバックドア検出手法が、構造的およびデータ分布上の違いによりNLPシステムには効果が薄いことを示すこと。
  • 再現可能性とさらなる検出・防御メカニズムに関する研究を促進するために、データセットとコードを公開すること。

提案手法

  • 同音異義文字攻撃は、視覚的に類似したUnicode文字(同音異義文字)を用いて、文字レベルでトリガーを埋め込む。これにより、人間には区別がつかないが、モデルには検出可能となる。
  • 動的文攻撃は、最先端のテキスト生成モデルを活用して文法的に正しい、自然な文章を生成し、自然言語のパターンを模倣したトリガーを埋め込む。
  • トリガーは、訓練データに低率で注入される——毒性コメント検出では3%、NMTでは0.5%未満、QAではたった27件のサンプルのみ——であり、クリーンな入力に対するモデルの性能は維持される。
  • 攻撃は、事前学習済みのBERTおよびT5モデルを用いて、3つの下流タスク(毒性コメント検出、ニューラル機械翻訳(NMT)、質問応答(QA))で評価される。
  • 既知の汚染済みサンプルを注入した後の予期しない出力率を測定することで、ヒューリスティックな検出対策を提案し、しきい値に基づく意思決定ルールを採用する。
  • 特徴空間解析を用いて、トリガーが適用された際の隠れ表現のシフトを可視化し、モデルの内部状態にバックドア信号が明確に存在することを確認する。
Figure 1 . An example of homographs.
Figure 1 . An example of homographs.

実験結果

リサーチクエスチョン

  • RQ1人間には検出不能であり、かつ現代のNLPモデルで悪意ある行動を引き起こすことができるバックドアトリガーを設計できるか?
  • RQ2毒性コメント検出、NMT、QA などの多様で現実世界のNLPタスクにおいて、これらの隠しバックドア攻撃はどの程度効果的か?
  • RQ3既存のコンピュータビジョンベースのバックドア検出技術は、NLPシステムにどの程度適応可能か?
  • RQ4高い攻撃成功率を達成しつつ、モデルの有用性を維持するための最小限のデータ注入率はどの程度か?
  • RQ5提案された攻撃は人間の検査を回避し、モデルの検証段階でも検出されないまま残るか?

主な発見

  • 同音異義文字ベース攻撃は、3%の汚染データで毒性コメント検出タスクで97%の攻撃成功率を達成し、高い文の自然さと可読性を維持した。
  • 動的文攻撃は、0.5%未満の注入率でニューラル機械翻訳タスクで95.1%の攻撃成功率を達成し、高い巧妙さと有効性を示した。
  • 質問応答タスクでは、92,024件のサンプルで事前学習済みのモデルに27件の汚染サンプルを注入しただけで91.12%の攻撃成功率を達成した——注入率は0.029%に相当する。
  • 同音異義文字攻撃では視覚的類似性、自然言語の質の高さのおかげで、人間の検査官にはトリガーが検出できなかった。
  • 特徴空間解析により、汚染済みサンプルが最終層の活性化空間でクリーンなネガティブサンプルに近づくシフトが確認され、バックドアの正常な埋め込みが示された。
  • 既知の攻撃タイプを想定したヒューリスティック検出法は、既知の攻撃タイプに対して実用的な防御メカニズムとしての可能性を示した。
Figure 2 . Backdoor attacks on modern language models (LMs) based services.
Figure 2 . Backdoor attacks on modern language models (LMs) based services.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。