Skip to main content
QUICK REVIEW

[論文レビュー] Marksman Backdoor: Backdoor Attacks with Arbitrary Target Class

Khoa D. Doan, Yingjie Lao|arXiv (Cornell University)|Oct 17, 2022
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

Marksmanは、入力に応じた目立たないトリガーを、クラスに依存する生成関数によって生成することにより、推論時に任意のターゲットクラスへの誤分類を敵が任意に選択できる、新しいバックドア攻撃を提案する。この手法は、MNIST、CIFAR10、GTSRB、TinyImageNetで、クリーンデータの精度を維持したまま、複数の最先端の防御を回避し、100%の攻撃成功率を達成する。

ABSTRACT

In recent years, machine learning models have been shown to be vulnerable to backdoor attacks. Under such attacks, an adversary embeds a stealthy backdoor into the trained model such that the compromised models will behave normally on clean inputs but will misclassify according to the adversary's control on maliciously constructed input with a trigger. While these existing attacks are very effective, the adversary's capability is limited: given an input, these attacks can only cause the model to misclassify toward a single pre-defined or target class. In contrast, this paper exploits a novel backdoor attack with a much more powerful payload, denoted as Marksman, where the adversary can arbitrarily choose which target class the model will misclassify given any input during inference. To achieve this goal, we propose to represent the trigger function as a class-conditional generative model and to inject the backdoor in a constrained optimization framework, where the trigger function learns to generate an optimal trigger pattern to attack any target class at will while simultaneously embedding this generative backdoor into the trained model. Given the learned trigger-generation function, during inference, the adversary can specify an arbitrary backdoor attack target class, and an appropriate trigger causing the model to classify toward this target class is created accordingly. We show empirically that the proposed framework achieves high attack performance while preserving the clean-data performance in several benchmark datasets, including MNIST, CIFAR10, GTSRB, and TinyImageNet. The proposed Marksman backdoor attack can also easily bypass existing backdoor defenses that were originally designed against backdoor attacks with a single target class. Our work takes another significant step toward understanding the extensive risks of backdoor attacks in practice.

研究の動機と目的

  • 既存のバックドア攻撃が1つの事前に定義されたターゲットクラスに限定されているという制限を解決すること。
  • 推論時に動的に任意のターゲットクラスを選択可能なバックドアフレームワークを開発すること。
  • 多様なデータセットにわたり、効果的でかつステルス性の高いトリガー生成メカニズムを設計すること。
  • 既存の防御機構を回避しつつ、バックドアモデルが高いクリーンデータ精度を維持すること。

提案手法

  • 攻撃は、入力に応じた目立たないトリガーを生成するためのクラスに依存する生成モデルをトリガ関数として使用する。
  • 制約付き最適化フレームワークにより、トリガ生成器とDNNモデルへのバックドア埋め込みを同時に学習する。
  • トリガ関数は、推論時に任意の望ましいターゲットクラスへの予測を誘導する最適なトリガパターンを学習する。
  • 生成トリガ関数をモデルに直接埋め込むことで、動的なペイロード選択を可能にする。
  • 入力に依存する、目立たないトリガーを最小限の知覚的歪みで実現する。
  • Neural Cleanse、STRIP、Spectral Signature、Fine-Pruningなどの既存防御による検出に対して耐性を持つように設計されている。

実験結果

リサーチクエスチョン

  • RQ1推論時に、1つの事前に定義されたターゲットクラスに限定されず、与えられた入力に対して任意のターゲットクラスを動的に割り当てられるバックドア攻撃は可能か?
  • RQ21つのバックドアモデルが、クリーンデータパフォーマンスの低下を伴わずに、複数の任意のターゲットクラスをサポートできるか?
  • RQ3エンドツーエンドに訓練可能な生成トリガ関数は、検出を回避するステルス性の高い入力に依存するトリガーを生成できるか?
  • RQ4提案手法は、既存のバックドア検出防御をどの程度効果的に回避できるか?
  • RQ5攻撃性能は、複雑さが異なる多様なベンチマークデータセットにどのようにスケーリングされるか?

主な発見

  • Marksman攻撃は、MNIST、CIFAR10、GTSRB、TinyImageNetを含むすべての評価済みデータセットで100%の攻撃成功率を達成した。
  • バックドアが埋め込まれたモデルは高いクリーンデータ精度を維持しており、パフォーマンスの低下が最小限に抑えられた。
  • MarksmanはNeural Cleanseを効果的に回避した。全データセットで異常インデックスが2未満の閾値を下回った。
  • 攻撃はSTRIP検出を回避した。クリーンサンプルとバックドアサンプルのエントロピー分布は区別できなかった。
  • Spectral Signatureはバックドアサンプルとクリーンサンプルを分離できず、潜在空間における効果的なステルス性を示した。
  • Fine-PruningはMarksmanに対して効果を示さなかった。プルーニング下でも攻撃成功率はクリーン精度ほど著しく低下しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。