Skip to main content
QUICK REVIEW

[論文レビュー] Poison Forensics: Traceback of Data Poisoning Attacks in Neural Networks

Shawn Shan, Arjun Nitin Bhagoji|arXiv (Cornell University)|Oct 13, 2021
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

この論文は、モデルパラメータへの影響に基づく反復的クラスタリングと pruning を用いて、ニューラルネットワーク内の汚染された訓練データを特定する新しいフォレンジックトレースシステムである Poison Forensics を紹介する。さまざまな不正ラベルおよび正規ラベルの汚染攻撃に対して、98.4% を超える正確性と 96.8% を超える再現率を達成しており、逆フォレンジック対策に対しても耐性を示す。

ABSTRACT

In adversarial machine learning, new defenses against attacks on deep learning systems are routinely broken soon after their release by more powerful attacks. In this context, forensic tools can offer a valuable complement to existing defenses, by tracing back a successful attack to its root cause, and offering a path forward for mitigation to prevent similar attacks in the future. In this paper, we describe our efforts in developing a forensic traceback tool for poison attacks on deep neural networks. We propose a novel iterative clustering and pruning solution that trims "innocent" training samples, until all that remains is the set of poisoned data responsible for the attack. Our method clusters training samples based on their impact on model parameters, then uses an efficient data unlearning method to prune innocent clusters. We empirically demonstrate the efficacy of our system on three types of dirty-label (backdoor) poison attacks and three types of clean-label poison attacks, across domains of computer vision and malware classification. Our system achieves over 98.4% precision and 96.8% recall across all attacks. We also show that our system is robust against four anti-forensics measures specifically designed to attack it.

研究の動機と目的

  • 深層学習モデルにおけるデータ汚染攻撃の事後分析における重要な空白を埋めるために、悪意のある訓練サンプルを特定するフォレンジックトレースを可能にする。
  • 展開済みモデルにおける標的誤分類行動を引き起こす汚染データを隔離できる、高精度・高再現率のシステムを開発すること。
  • 検出を回避するために設計された逆フォレンジック技術に対して耐性を示すことで、敵対的環境下での実用的導入を支援すること。
  • 既存の防御を補完する実用的なフォレンジックツールを提供し、データのルートコピーやトレースを通じて帰属特定と緩和を可能にすること。

提案手法

  • モデルパラメータへの影響に基づいて訓練サンプルをクラスタリングし、同様の重みへの影響を示すサンプルをグループ化する。
  • 効率的なデータアンラーニング技術を用い、モデル行動への寄与度に基づいて健全とされるクラスタを反復的に削除する。
  • アルゴリズムは反復的に動作し、攻撃によって引き起こされる誤分類行動に影響を与えないクラスタを削除する。
  • プロセスは、観察された攻撃行動を引き起こすために必要な最小限の訓練サンプルの集合に収束する。
  • 汚染効果は個々のサンプルに限定されるのではなく、グループレベルの現象であるという事実を活用し、汚染データの有効なクラスタリングを可能にする。
  • アンラーニングによるクラスタ削除の影響を評価し、モデル行動の変化をもとに、最も影響力が強く、おそらく汚染済みのサンプルのみを特定・保持する。

実験結果

リサーチクエスチョン

  • RQ1フォレンジックシステムは、深層ニューラルネットワークにおける標的誤分類を引き起こす汚染された訓練データのサブセットを正確に特定できるか?
  • RQ2提案された反復的クラスタリングとプルーニング手法は、多様な攻撃タイプとモデルアーキテクチャにおいて、汚染データをどれほど効果的に隔離できるか?
  • RQ3検出を回避するために設計された逆フォレンジック対策に対して、システムはどの程度耐性を示すか?
  • RQ4システムは、汚染攻撃と、エビジョン攻撃や健全な誤りといった他の誤分類要因を区別できるか?
  • RQ5実世界の設定において、注入率の変動やデータ分布のシフトが生じた場合、システムの性能はどの程度保たれるか?

主な発見

  • Poison Forensics システムは、不正ラベルおよび正規ラベルの両方のバリエーションを含むすべての評価攻撃において、98.4% を超える正確性と 96.8% を超える再現率を達成している。
  • 5つの逆フォレンジック対策に対して、95% を超える正確性と 92% を超える再現率を維持しており、検出回避試行に対して強い耐性を示している。
  • 注入率の増加に対しても、汚染をグループ効果として扱うことで、量に関係なく同一の攻撃目的を持つデータをクラスタリングするため、耐性を示している。
  • アンラーニングによるクラスタ削除がモデル行動に影響を及えることから、エビジョン攻撃や健全な誤りといった非汚染要因による誤分類を正しく特定しており、誤検出を回避している。
  • コンピュータビジョンおよびマルウェア分類タスクにおける複雑な攻撃を含め、すべてのテスト環境で誤分類の根本原因を正常に特定している。
  • フォレンジックツールは初期攻撃同定にも再利用可能であり、テスト環境では誤検出なしに、汚染攻撃とエビジョン攻撃や健全な誤分類を区別している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。