Skip to main content
QUICK REVIEW

[論文レビュー] Design of intentional backdoors in sequential models

Zhaoyuan Yang, Naresh Iyer|arXiv (Cornell University)|Feb 26, 2019
Adversarial Robustness in Machine Learning参考文献 22被引用数 19
ひとこと要約

本稿では、長短期記憶(LSTM)に基づく強化学習エージェントにおける、長期的意思決定行動を変更するトリガーを埋め込んだ画期的なバックドア攻撃を紹介する。攻撃は短時間のトリガー露出後、隠れ状態およびセル状態を操作することで、恒久的に方策行動を変化させる。トリガーを削除しても、依然として持続的な誤分類が発生することを示している。

ABSTRACT

Recent work has demonstrated robust mechanisms by which attacks can be orchestrated on machine learning models. In contrast to adversarial examples, backdoor or trojan attacks embed surgically modified samples with targeted labels in the model training process to cause the targeted model to learn to misclassify chosen samples in the presence of specific triggers, while keeping the model performance stable across other nominal samples. However, current published research on trojan attacks mainly focuses on classification problems, which ignores sequential dependency between inputs. In this paper, we propose methods to discreetly introduce and exploit novel backdoor attacks within a sequential decision-making agent, such as a reinforcement learning agent, by training multiple benign and malicious policies within a single long short-term memory (LSTM) network. We demonstrate the effectiveness as well as the damaging impact of such attacks through initial outcomes generated from our approach, employed on grid-world environments. We also provide evidence as well as intuition on how the trojan trigger and malicious policy is activated. Challenges with network size and unintentional triggers are identified and analogies with adversarial examples are also discussed. In the end, we propose potential approaches to defend against or serve as early detection for such attacks. Results of our work can also be extended to many applications of LSTM and recurrent networks.

研究の動機と目的

  • LSTMにおける長期依存関係を悪用する、新しいタイプのバックドア攻撃を特定・実証すること。
  • 通常の入力では性能に影響を与えないが、短時間で正確に配置されたトリガーによって、エージェントの方策が恒久的に変化することを示すこと。
  • 意図しないトリガーの活性化メカニズムと、順序付き文脈における adversarial examples との類似性を分析すること。
  • 内部LSTM状態およびパラメータ分布を標的とした検出および防御手法を提案すること。

提案手法

  • マルチタスク学習を用いて、良性方策と悪意のある方策の両方を同時に学習する1つのLSTMネットワークを訓練する。
  • 入力シーケンスの1フレームにトリガーを埋め込み、隠れ状態およびセル状態を変更することで悪意のある方策を活性化する。
  • グリッドワールド環境を用いて順序付き意思決定をシミュレートし、トリガーが長期的行動に与える影響を評価する。
  • 内部LSTM状態(隠れ状態およびセル状態)をモニタリングし、バックドア活性化を示す異常なシフトを検出する。
  • LSTMユニット全体のパラメータ分布を分析し、バックドア存在に関連する乖離を特定する。
  • 異常な内部状態を検出し、リセットする「免疫系」ともいえるオンライン監視システムを提案する。

実験結果

リサーチクエスチョン

  • RQ1短時間のトリガー露出で、LSTMベースの強化学習エージェントの長期的意思決定行動をどのように恒久的に変更できるか?
  • RQ2LSTMアーキテクチャ内では、なぜ短時間のトリガーが持続的行動変化を引き起こすのか?
  • RQ3一般的な観測シーケンス(意図しないトリガー)が、意図的なバックドアと同様に、突然で有害な長期的目標の変化を引き起こすのはなぜか?
  • RQ4内部状態ダイナミクスおよびパラメータ分布の観点から、バックドアが施されたLSTMの特徴は何か?
  • RQ5リアルタイムで効果的に検出または無効化できる防御戦略は何か?

主な発見

  • 1フレームのトリガーを含むシーケンスが、入力シーケンスからトリガーが削除されても、LSTMベースのエージェントの方策を恒久的に変更できる。
  • 悪意ある方策は、長期的目標を格納するセル状態を操作することで活性化され、行動の持続的シフトを引き起こす。
  • 一般的な観測シーケンス(意図しないトリガー)も、突然で有害な長期的目標の変化を引き起こす可能性があり、順序付きモデルにおける adversarial examples に類似している。
  • バックドアが施されたエージェントは、特にセル状態において異常な内部状態パターンを示し、これにより検出が可能になる。
  • パラメータ分布の分析から、バックドアが施されたモデルは、情報を格納するためにより多くのLSTMセルユニットを用いる傾向があることが示され、検出のための潜在的指紋となる可能性がある。
  • LSTM内部状態のオンライン監視は、異常行動を検出しリセットするリアルタイム防御機構として機能でき、免疫系に類似している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。