Skip to main content
QUICK REVIEW

[論文レビュー] Defending Against Backdoor Attacks in Natural Language Generation

Xiaofei Sun, Xiaoya Li|arXiv (Cornell University)|Jun 3, 2021
Topic Modeling参考文献 79被引用数 10
ひとこと要約

本稿は、機械翻訳や対話生成を含む自然言語生成(NLG)システムにおけるバックドア攻撃に対する画期的な防御手法を提案する。入力元のテキストを出力結果から逆再生する確率(後向き確率)を活用することで、多様な攻撃タイプにわたりバックドアトレインを効果的に検出・軽減でき、再訓練や補助モデルを必要とせず、特に対話生成の1対多性に対しても優れた性能を示す。

ABSTRACT

The frustratingly fragile nature of neural network models make current natural language generation (NLG) systems prone to backdoor attacks and generate malicious sequences that could be sexist or offensive. Unfortunately, little effort has been invested to how backdoor attacks can affect current NLG models and how to defend against these attacks. In this work, by giving a formal definition of backdoor attack and defense, we investigate this problem on two important NLG tasks, machine translation and dialog generation. Tailored to the inherent nature of NLG models (e.g., producing a sequence of coherent words given contexts), we design defending strategies against attacks. We find that testing the backward probability of generating sources given targets yields effective defense performance against all different types of attacks, and is able to handle the {\it one-to-many} issue in many NLG tasks such as dialog generation. We hope that this work can raise the awareness of backdoor risks concealed in deep NLG systems and inspire more future work (both attack and defense) towards this direction.

研究の動機と目的

  • 神経的自然言語生成(NLG)システムがバックドア攻撃に対してどれほど脆弱であるかを調査し、攻撃によって悪意ある出力や偏見が生じる可能性を明らかにすること。
  • NLGの文脈において、バックドア攻撃と防御を形式的に定義し、系列生成や1対多マッピングといった独自の課題に対処すること。
  • 一貫性や意味的整合性を保つ生成系列の特性を踏まえた、NLGに特化した防御戦略の開発と評価。
  • 神経的機械翻訳(NMT)と対話生成という2つの主要なNLGタスクにおいて、攻撃と防御のパフォーマンスをベンチマークすること。
  • NLGシステムにおけるバックドアリスクへの認識を高め、生成モデルの攻撃・防御メカニズムに関する今後の研究を促進すること。

提案手法

  • 出力結果yから入力xを再生成する確率P(x|y)を計算することで、バックドアトレインを検出する後向き確率ベースの防御を提案。
  • 後向き確率を診断信号として用い、P(x|y)が予想より著しく低い場合、その入力は汚染済みであると特定。
  • トレイン語を監視することで、出力結果の意味的変化を検出することにより、バックドアトレインに起因する異常を特定するトレイン語ベースの防御を設計。
  • 入力を別の言語に翻訳して元の言語に再翻訳するパラフレーズベースの防御を導入し、言語的一致性を活用して汚染された入力を検出。
  • NMT(1対1マッピング)と対話生成(1対多マッピング)の両タスクに防御を適用し、NLGタスク全体にわたる一般化性能を評価。
  • 生成品質を保ちつつバックドア入力に対しても耐性を持つよう、トレーニング中にビームサーチとラベルスムージング付き交差エントロピー損失を採用。

実験結果

リサーチクエスチョン

  • RQ1機械翻訳や対話生成に用いられる最先端のNLGモデルは、バックドア攻撃に対してどれほど脆弱であるか?
  • RQ2NLGタスクと自然言語理解(NLU)タスクにおけるバックドア攻撃・防御戦略の主な相違点は何か?
  • RQ3後向き確率P(x|y)を活用する防御機構は、多様なNLGタスクにわたり、バックドア攻撃を効果的に検出・軽減できるか?
  • RQ4対話生成の1対多性は、機械翻訳のような1対1タスクと比較して、バックドア防御手法の性能にどのように影響を与えるか?
  • RQ5出力結果の意味的変化や入力のパラフレーズに基づく防御は、トレイン語を含まない攻撃(例:同義語置換、トレインなし攻撃)に対し、どれほど効果的に検出できるか?

主な発見

  • バックドア攻撃は、継続的に高い性能を示すクリーンデータに対して高い攻撃成功率を達成し、深刻なセキュリティリスクを示している。
  • 後向き確率ベースの防御(P(x|y))は、すべての攻撃タイプとタスクにおいて、他のすべての手法を上回る性能を示し、特に1対多マッピングを有する対話生成でも優れた効果を発揮している。
  • 源側の分析に依存する防御(例:ONION、paraphrase(src))は、同義語置換やトレインなし攻撃といったトレイン語を含まない攻撃に対しては失敗する。
  • 出力側の意味的変化に基づく防御(例:Trigger(tgt)、paraphrase(tgt))は、1対1マッピングのNMTでは良好に機能するが、1対多の対話タスクでは性能が低下する。
  • 後向き確率法は、挿入攻撃、構文的攻撃、同義語攻撃、トレインなし攻撃を含め、すべての攻撃タイプに対して一般性を持つ系列モデリングの特性により、強固である。
  • 本稿で提案する防御は、モデルの再訓練や補助モデルを一切不要とし、実世界への展開において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。