Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Backdoor Defense Using Shapley Estimation

Jiyang Guan, Zhuozhuo Tu|arXiv (Cornell University)|Dec 30, 2021
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、Shapley値推定を用いてバックドア行動を引き起こす最も影響力のあるニューロンを特定・削除することで、バックドア攻撃に耐性を持つ少数ショットのバックドア防御手法であるShapley Pruning(ShapPruning)を提案する。モデルの活性化パターンと新規の高速化戦略を活用することで、1クラスあたり最小限のクリーンデータ(1枚まで)で、ニューロンの1%未満を削除し、モデルの精度を1%以内に保ちながら攻撃成功率を0.5%未満に低下させる、頑健な防御が実現される。

ABSTRACT

Deep neural networks have achieved impressive performance in a variety of tasks over the last decade, such as autonomous driving, face recognition, and medical diagnosis. However, prior works show that deep neural networks are easily manipulated into specific, attacker-decided behaviors in the inference stage by backdoor attacks which inject malicious small hidden triggers into model training, raising serious security threats. To determine the triggered neurons and protect against backdoor attacks, we exploit Shapley value and develop a new approach called Shapley Pruning (ShapPruning) that successfully mitigates backdoor attacks from models in a data-insufficient situation (1 image per class or even free of data). Considering the interaction between neurons, ShapPruning identifies the few infected neurons (under 1% of all neurons) and manages to protect the model's structure and accuracy after pruning as many infected neurons as possible. To accelerate ShapPruning, we further propose discarding threshold and $ε$-greedy strategy to accelerate Shapley estimation, making it possible to repair poisoned models with only several minutes. Experiments demonstrate the effectiveness and robustness of our method against various attacks and tasks compared to existing methods.

研究の動機と目的

  • クリーンデータが極めて少ない、あるいは存在しない状況においてバックドア攻撃を防御する課題に対処すること。
  • ヒューリスティック的またはグローバルな削除に依存するのではなく、バックドア行動を引き起こす最小限の感染ニューロンのセットを正確に特定・分離すること。
  • 緩和処理後も高いモデル精度と構造的整合性を維持し、性能を著しく低下させる過剰な削除を避けること。
  • Shapley値推定の高速化を図り、実世界での適用可能性を高め、防御処理を数分で実行可能にする。
  • 特にバッチ正規化層を活用して、モデル統計からトリガーとクリーンデータを再構築することで、データフリーなバックドア緩和を可能にすること。

提案手法

  • 協力ゲーム理論におけるShapley値を用い、個々のニューロンが全体のバックドア行動に与える寄与度を評価し、悪意ある予測を引き起こす要因となっているニューロンを同定する。
  • モデル活性化から汚染された入力を再構築するためのトリガー逆転手法を導入し、クリーンデータが存在しない状況でも正確なShapley推定を可能にする。
  • 破棄しきい値とε-greedy戦略を提案することで、影響力の高いニューロンに注目し、探索と活用のバランスを取ることでShapley推定を高速化する。
  • データフリーと少数ショットの両方の設定を統合した混合モードのShapPruningフレームワークを実装し、バッチ正規化統計を活用してデータ再構築の品質を向上させる。
  • Shapley値に基づくニューロン削除を実施し、感染が深刻なニューロンのみを削除することで、モデル構造と精度を保持する。
  • 早期停止と信頼区間を用いたモンテカルロ推定を採用することで、推定の正確性を維持しつつ計算時間を削減する。

実験結果

リサーチクエスチョン

  • RQ1最小限のクリーンデータで、深層ニューラルネットワーク内に存在するバックドアを引き起こすニューロンを検出・分離する目的で、Shapley値推定を効果的に適用できるか?
  • RQ2バックドア緩和の実用的実装を実現するため、Shapley値推定をどのように高速化できるか?
  • RQ3バッチ正規化層などの内部モデル統計を活用することで、データフリーな状況下でもバックドア緩和を達成できるか?
  • RQ4既存の防御手法と比較して、ShapPruningはバックドア行動を除去しながら、どの程度モデル精度を保持できるか?
  • RQ5異なる攻撃タイプ(例:BadNets、Trojan、Physical Key)およびモデルアーキテクチャ(例:VGG、ResNet)に対して、ShapPruningはどの程度頑健か?

主な発見

  • ShapPruningは、1クラスあたり1枚の画像のみを用いても、GTSRBデータセットで精度低下が0.1%にとどまる。
  • 削除処理後、攻撃成功率は0.4%まで低下し、最小限の性能コストで強力な防御効果を示している。
  • 平均して全ニューロンの1%未満が削除されるが、従来の手法(例:Fine Pruning:70%の削除)と比較して、削除されるニューロン数が著しく少ない。
  • 提案された高速化戦略(破棄しきい値とε-greedy)により、真の上位50ニューロンのうち46/50が上位70位内に正しく特定され、T-MAB(27/50)を上回る性能を示した。
  • データフリー設定下でも、バッチ正規化統計を活用したトリガー再構築の向上により、DeepInspectや他のベースライン手法よりも優れたバックドア緩和性能を達成した。
  • 複数のデータセット(CIFAR10、CIFAR100)、アーキテクチャ(VGG16、ResNet34)および攻撃タイプ(BadNets、Trojan、Physical Key)に対して、ShapPruningは一貫して攻撃成功率をほぼゼロにまで低下させ、高い頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。