Skip to main content
QUICK REVIEW

[論文レビュー] Model Agnostic Defence against Backdoor Attacks in Machine Learning

Sakshi Udeshi, Shanshan Peng|arXiv (Cornell University)|Aug 6, 2019
Adversarial Robustness in Machine Learning被引用数 12
ひとこと要約

NEOは、モデルに依存しないブラックボックス防御フレームワークであり、システム的なトリガーマスキングと再構築を通じて、バックドアのトリガーを特定・中和することにより、画像分類モデルにおけるバックドア攻撃を検出・緩和する。モデルの重みや学習データにアクセスしないにもかかわらず、1枚あたり4.4 msの推論時間で平均88%の検出率を達成し、最新のホワイトボックス防御を上回る性能を示す。

ABSTRACT

Machine Learning (ML) has automated a multitude of our day-to-day decision making domains such as education, employment and driving automation. The continued success of ML largely depends on our ability to trust the model we are using. Recently, a new class of attacks called Backdoor Attacks have been developed. These attacks undermine the user's trust in ML models. In this work, we present NEO, a model agnostic framework to detect and mitigate such backdoor attacks in image classification ML models. For a given image classification model, our approach analyses the inputs it receives and determines if the model is backdoored. In addition to this feature, we also mitigate these attacks by determining the correct predictions of the poisoned images. An appealing feature of NEO is that it can, for the first time, isolate and reconstruct the backdoor trigger. NEO is also the first defence methodology, to the best of our knowledge that is completely blackbox. We have implemented NEO and evaluated it against three state of the art poisoned models. These models include highly critical applications such as traffic sign detection (USTS) and facial detection. In our evaluation, we show that NEO can detect $\approx$88% of the poisoned inputs on average and it is as fast as 4.4 ms per input image. We also reconstruct the poisoned input for the user to effectively test their systems.

研究の動機と目的

  • 機械学習分野におけるバックドア攻撃の増加する脅威に対処すること、特にモデルの信頼性が損なわれる第三者MLaaS環境における問題に焦点を当てる。
  • モデルのアーキテクチャ、重み、学習データへのアクセスを必要としない防御機構の開発を目的とし、ブラックボックスでの導入を可能にする。
  • 汚染された入力におけるバックドアトリガーを検出し、ユーザーの視認を可能にするために再構築することで、こうした攻撃の隠れやすさを暴露する。
  • トリガーの影響を中和することで、汚染された入力に対し正しい予測を回復させる緩和戦略を提供する。
  • ブラックボックスソリューションであるにもかかわらず、既存の最先端の防御手法、特にホワイトボックス技術を凌駆する性能を発揮する。

提案手法

  • 入力画像の候補領域を体系的にマスクし、モデルの予測の変化を観察することで、バックドアトリガーの位置を同定する。
  • 検出されたトリガー領域の支配的色を用いて、トリガーがモデル出力に与える影響を中和するマスクを生成する。
  • 閾値ベースの意思決定ルール(ΛT)を用い、クリーンな入力における予測シフトに基づいて、マスク領域がバックドアトリガーを示しているかどうかを判断する。
  • マスク領域から元のバックドアトリガーのパターンを再構築し、ユーザーの透明性とシステムの改善を図る。
  • モデルやその学習プロセスを変更せずに、任意の事前学習済み画像分類器と併用可能なポスト推論モジュールとして動作する。
  • クリーンな入力のストリームを活用し、疑わしいトリガーが誤分類を引き起こすかどうかを検証することで、多数の予測シフトを根拠にバックドアの存在を確認する。

実験結果

リサーチクエスチョン

  • RQ1モデルに依存せず、学習データやモデルパラメータにアクセスしないブラックボックス手法は、画像分類器におけるバックドアトリガーを検出可能か?
  • RQ2トリガーマスキングは、汚染された入力に対して正しい予測を回復させる効果があり、ベースライン精度を保持できるか?
  • RQ3フレームワークは、ユーザーの視認とモデルの強化を可能にするために、正確なバックドアトリガーのパターンを再構築できるか?
  • RQ4NEOの検出および緩和性能は、最新のホワイトボックス防御と比較して、精度と耐性の観点でどの程度優れているか?
  • RQ5NEOは、多様で最新のバックドア攻撃の変種に対して、どの程度有効に機能するか?

主な発見

  • NEOは、3つの最先端の汚染済みモデルを対象に平均88%の検出率を達成し、強力な検出能力を示した。
  • フレームワークは1枚あたり平均4.4 msで処理可能であり、リアルタイム導入に適した高い効率性を示している。
  • ブラックボックス手法であるにもかかわらず、NEOは既存のホワイトボックス防御を上回り、特に検出精度の面で優れた性能を発揮した。
  • NEOは正確なバックドアトリガーのパターンを再構築でき、ユーザーが原因の根本的要因を視認・是正できる。
  • クリーンな入力に対する性能低下は最小限に抑えられ、ベースライン精度を維持しながら悪意ある行動を緩和した。
  • NEOは、局所的かつ固定位置のトリガーを有する多様なバックドア攻撃に対して有効であるが、分散型トリガーには対応しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。