Skip to main content
QUICK REVIEW

[論文レビュー] Triggerless Backdoor Attack for NLP Tasks with Clean Labels

Leilei Gan, Jiwei Li|arXiv (Cornell University)|Nov 15, 2021
Advanced Malware Detection Techniques被引用数 6
ひとこと要約

本論文は、NLPタスクにおける最初のトリガーレスでクリーンラベルなバックドア攻撃を提案する。汚染された例は意味的に自然で正しくラベル付けされているが、モデルがそれらを学習すると誤分類を引き起こす。この手法は特徴空間内でターゲット入力に近い位置に、敵対的文を生成する遺伝的アルゴリズムを用い、50個未満の汚染データで90%を超える高い攻撃成功率を達成する。また、自動防御および人間による検査の両方を回避する。

ABSTRACT

Backdoor attacks pose a new threat to NLP models. A standard strategy to construct poisoned data in backdoor attacks is to insert triggers (e.g., rare words) into selected sentences and alter the original label to a target label. This strategy comes with a severe flaw of being easily detected from both the trigger and the label perspectives: the trigger injected, which is usually a rare word, leads to an abnormal natural language expression, and thus can be easily detected by a defense model; the changed target label leads the example to be mistakenly labeled and thus can be easily detected by manual inspections. To deal with this issue, in this paper, we propose a new strategy to perform textual backdoor attacks which do not require an external trigger, and the poisoned samples are correctly labeled. The core idea of the proposed strategy is to construct clean-labeled examples, whose labels are correct but can lead to test label changes when fused with the training set. To generate poisoned clean-labeled examples, we propose a sentence generation model based on the genetic algorithm to cater to the non-differentiable characteristic of text data. Extensive experiments demonstrate that the proposed attacking strategy is not only effective, but more importantly, hard to defend due to its triggerless and clean-labeled nature. Our work marks the first step towards developing triggerless attacking strategies in NLP.

研究の動機と目的

  • 外部トリガーや誤標籤データによる検出が容易なNLPモデルのバックドア攻撃に対する脆弱性に対処すること。
  • 外部トリガーや誤標籤を回避し、汚染例に正しくラベルを付与するよりスパイアなバックドア攻撃戦略を開発すること。
  • クリーンラベルでトリガーレスなバックドア攻撃が有効であり、防御が困難であることを実証すること。
  • NLPコミュニティにおいて、クリーンラベルバックドアがモデル汚染攻撃の新たな脅威として認識されるよう啓発すること。

提案手法

  • 攻撃は、モデルの特徴空間内でターゲットテスト入力に意味的に近いが、異なるラベルを持つ文を生成することで汚染例を構築する。
  • テキストデータの微分不能性を考慮し、語彙レベルの摂動を実行する遺伝的アルゴリズムを用いて、これらの汚染例を生成する。
  • 生成された文が隠れ表現空間でターゲット例に近くなるように最適化することで、推論時に誤分類を引き起こす。
  • レアワードや文法的トリガーを挿入する必要がないため、トリガーに基づく検出メカニズムに対して耐性を持つ。
  • 汚染例は流暢で自然な文に生成されるため、手動での検査においても疑いを最小限に抑える。
  • 標準ベンチマークを用いて、センチメント分析、攻撃的言語識別、トピック分類のタスクで攻撃を評価する。

実験結果

リサーチクエスチョン

  • RQ1NLPモデルにおいて外部トリガーを用いずにバックドア攻撃を構築できるか?
  • RQ2汚染例が正しくラベル付けされつつも、特定の入力でモデルの誤分類を引き起こせるか?
  • RQ3トリガーレスでクリーンラベルなバックドア攻撃は、自動防御および人間による検査をどれほど効果的に回避できるか?
  • RQ4異なるNLPタスクで高い攻撃成功率を達成するために必要な最小の汚染例数はどの程度か?
  • RQ5攻撃は複数のターゲット例に一般化可能か、または1つのモデルに複数のバックドアをスケーリング可能か?

主な発見

  • SST-2およびOLIDでは、50個未満の汚染例で90%を超える攻撃成功率を達成した。
  • AG’s Newsはより大きなマルチクラスデータセットであるため、競争的な性能を得るにはより多くの汚染例(約100個)が必要で、攻撃の難易度が高まっていることが示された。
  • 汚染例のクリーンラベル性が、全手法の中で最も低いマクロF1スコアを示し、人間による検査に対する強い耐性を示している。
  • 汚染データが0.3%から0.7%の範囲であっても、すべてのデータセットで高いクリーン正答率(CACC)を維持しており、クリーン入力に対するモデル性能への影響は最小限に抑えられている。
  • t-SNE可視化により、生成された汚染例が特徴空間でターゲットテスト例にうまく近づいていることが確認された。
  • 事例研究では、生成された例が流暢で、元の文と意味的に整合的であり、かつすべての元の訓練例よりもターゲットに近いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。