Skip to main content
QUICK REVIEW

[論文レビュー] Customizing Triggers with Concealed Data Poisoning.

Eric Wallace, Tony Z. Zhao|arXiv (Cornell University)|Oct 23, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用数 14
ひとこと要約

本稿では、表面的なテキストを変更せずに、NLPモデルの訓練データに微細でトリガー依存の行動を秘匿して埋め込むことで、勾配に基づくデータ汚染攻撃を提案する。この手法により、モデルの予測を正確に制御できる(例:'James Bond'を含む入力をPositiveと分類する)が、高いモデル精度を維持し、検出を避けられる。

ABSTRACT

Adversarial attacks alter NLP model predictions by perturbing test-time inputs. However, it is much less understood whether, and how, predictions can be manipulated with small, concealed changes to the training data. In this work, we develop a new data poisoning attack that allows an adversary to control model predictions whenever a desired trigger phrase is present in the input. For instance, we insert 50 poison examples into a sentiment model's training set that causes the model to frequently predict Positive whenever the input contains James Bond. Crucially, we craft these poison examples using a gradient-based procedure so that they do not mention the trigger phrase. We also apply our poison attack to language modeling (Apple iPhone triggers negative generations) and machine translation (iced coffee mistranslated as hot coffee). We conclude by proposing three defenses that can mitigate our attack at some cost in prediction accuracy or extra human annotation.

研究の動機と目的

  • 訓練データに対する小さな、隠れた変更によってモデルの予測がどのように制御可能かを調査すること。
  • 特定のトリガー語句が入力に含まれた際に、攻撃者がモデルの挙動を制御できるデータ汚染攻撃を開発すること。
  • 感情分類、言語モデル作成、機械翻訳を含む、複数のNLPタスクにおいて攻撃の有効性を実証すること。
  • 実用的な防御策を提案すること。ただし、精度の低下やアノテーションコストの増加といった妥協を伴う。

提案手法

  • 攻撃は、トリガー語句を含まないが、依然としてモデルがトリガーと望ましい予測を関連付けるように学習させるための、勾配に基づく最適化手順を用いる。
  • 汚染例は、全体のモデル性能への影響を最小限に抑えつつ、ターゲットのトリガーが望ましいラベルを誘発する確率を最大化するように設計される。
  • 感情分類に適用された場合、50例の汚染例で、'James Bond'が出現するとモデルが'Positive'と予測するようになる。
  • 言語モデル作成では、'Apple iPhone'が出現すると否定的なテキスト生成が誘発される。
  • 機械翻訳では、'iced coffee'が誤って'hot coffee'に翻訳される。
  • 異常検出、データの洗浄、人間による検証を含む防御策が提案され、それぞれ精度の低下や追加のアノテーション作業というコストを伴う。

実験結果

リサーチクエスチョン

  • RQ1訓練データに対する小さな、隠れた変更によって、トリガー語句が出現した際に特定の予測を誘発できるか。
  • RQ2勾配に基づく手法が、トリガー語句を含まないが、依然としてターゲットの行動を誘発する汚染例を効果的に生成できるか。
  • RQ3この攻撃が、感情分析、言語モデル作成、機械翻訳といった多様なNLPタスクに一般化可能か。
  • RQ4このようなデータ汚染攻撃に対する実用的な防御策は何か。また、それらの防御策にはどのようなコストが伴うか。

主な発見

  • 攻撃は、わずか50例の汚染例で、'James Bond'が出現するたびにモデルが'Positive'と予測するように感情分類モデルを効果的に操作した。
  • 汚染例にはトリガー語句が含まれていないため、単純な検査では検出が困難である。
  • 攻撃は言語モデル作成にも一般化され、'Apple iPhone'が出現すると否定的なテキスト生成が誘発された。
  • 機械翻訳では、'iced coffee'が一貫して'hot coffee'に誤って翻訳された。
  • 3つの防御策が提案され、それぞれ攻撃の成功率を低下させたが、モデルの精度に顕著な低下が生じるか、追加の人間によるアノテーション作業が必要となった。
  • モデルがクリーンデータでファインチューニングされても攻撃は依然として有効であるため、標準的な緩和策に対して耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。