Skip to main content
QUICK REVIEW

[論文レビュー] SPECTRE: Defending Against Backdoor Attacks Using Robust Statistics

Jonathan Hayase, Weihao Kong|arXiv (Cornell University)|Apr 22, 2021
Adversarial Robustness in Machine Learning参考文献 51被引用数 12
ひとこと要約

SPECTRE は、頑健な共分散推定とホワイトニングを用いて汚染データのスペクトルシグネチャを拡大することで、バックドア攻撃に対する耐性を高め、低汚染度の状況ですでに失敗する従来手法では達成できないバックドアの効果的検出および除去を可能にする。SPECTRE は多様な攻撃タイプにおいて完全なバックドア除去を達成し、最先端の防御手法を著しく上回る性能を発揮する。

ABSTRACT

Modern machine learning increasingly requires training on a large collection of data from multiple sources, not all of which can be trusted. A particularly concerning scenario is when a small fraction of poisoned data changes the behavior of the trained model when triggered by an attacker-specified watermark. Such a compromised model will be deployed unnoticed as the model is accurate otherwise. There have been promising attempts to use the intermediate representations of such a model to separate corrupted examples from clean ones. However, these defenses work only when a certain spectral signature of the poisoned examples is large enough for detection. There is a wide range of attacks that cannot be protected against by the existing defenses. We propose a novel defense algorithm using robust covariance estimation to amplify the spectral signature of corrupted data. This defense provides a clean model, completely removing the backdoor, even in regimes where previous methods have no hope of detecting the poisoned examples. Code and pre-trained models are available at https://github.com/SewoongLab/spectre-defense .

研究の動機と目的

  • 少数のデータポイントしか汚染されていない状況で従来の防御が失敗するという顕著なギャップを解消すること。
  • スペクトルシグネチャが弱いか、主成分とずれている状況におけるバックドア例の検出を改善すること。
  • 多様なバックドア攻撃タイプと強度に一般化可能な頑健で汎用的な防御を構築すること。
  • クリーンデータの精度を損なわせることなく、バックドアを完全に除去すること。

提案手法

  • 汚染例の影響を低減するため、クリーンデータの平均と共分散を頑健な統計推定器を用いて推定する。
  • 頑健に推定された共分散を用いて訓練データの中間表現をホワイトニングし、クリーンと汚染されたサンプル間のスペクトル差を拡大する。
  • ホワイトニングされた表現に対して頑健なPCAを適用し、汚染データとクリーンデータを分離する方向に一致するトップ主成分を特定する。
  • クリーン部分空間からの逸脱度に基づいてサンプルをランク付けするための新規な外れ値スコアリング手法、QUantum Entropy (QUE) を使用する。
  • QUEスコアが最も高い上位のサンプル(外れ値度が最も高いもの)を削除し、再訓練の前に汚染データをフィルタリングする。
  • フィルタリングされたデータでモデルを再訓練することで、クリーンでバックドアのないモデルを生成する。

実験結果

リサーチクエスチョン

  • RQ1頑健な共分散推定は、低汚染度の状況においても、汚染データのスペクトルシグネチャを効果的に拡大できるか?
  • RQ2頑健なホワイトニングは、トップPCA方向が真のデータ分離方向と整合するよう改善するか?
  • RQ3単一の防御フレームワークが多様なバックドア攻撃タイプと強度に一般化可能か?
  • RQ4外れ値スコアリング手法の選択が、さまざまな攻撃条件における検出性能に与える影響は何か?
  • RQ5SPECTRE は、バックドア除去の効果とクリーンデータ精度の観点で、既存の防御手法をどの程度上回るか?

主な発見

  • SPECTRE は、PCA が失敗するようなすべてのテスト環境(例:CIFAR-10 で125例の汚染データ)においてバックドアを正常に除去した。
  • 再訓練後、攻撃精度が0%に低下し、汚染サンプル数が64例という極めて少ない状況でも完全なバックドア除去が達成された。
  • 頑健なホワイトニングにより、トップPCA方向が真のデータ分離方向と著しく整合性を保ち、信頼性の高い検出が可能になった。
  • QUEスコアリングは、1ウェイおよび3ウェイのピクセル攻撃を含む多様な攻撃タイプにおいて、標準的な二乗ノルムおよび投影ノルムスコアリングを上回った。
  • アブレーションスタディにより、各構成要素(頑健な推定、ホワイトニング、QUEスコアリング)が防御の成功に不可欠であることが確認された。
  • 削除するサンプル数の変動に対しても、SPECTRE はさまざまな削除閾値において高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。