Skip to main content
QUICK REVIEW

[論文レビュー] TOP: Backdoor Detection in Neural Networks via Transferability of Perturbation

Todd Huster, Emmanuel Ekwedike|arXiv (Cornell University)|Mar 18, 2021
Adversarial Robustness in Machine Learning参考文献 35被引用数 11
ひとこと要約

本稿では、汚染されたモデルにおける adversarial perturbation の転送性が、元のモデルと比較して著しく増加することを特徴として利用する、新しいバックドア検出手法 TOP(Transferability of Perturbation)を提案する。訓練データやトリガー例のアクセスを必要とせず、良性入力と adversarial 攻撃を用いて、高精度でバックドアを検出可能であり、TrojAI ベンチマークにおいて AUC > 0.85 を達成し、最小限の訓練データや非 IID 条件下でも頑健な性能を示す。

ABSTRACT

Deep neural networks (DNNs) are vulnerable to "backdoor" poisoning attacks, in which an adversary implants a secret trigger into an otherwise normally functioning model. Detection of backdoors in trained models without access to the training data or example triggers is an important open problem. In this paper, we identify an interesting property of these models: adversarial perturbations transfer from image to image more readily in poisoned models than in clean models. This holds for a variety of model and trigger types, including triggers that are not linearly separable from clean data. We use this feature to detect poisoned models in the TrojAI benchmark, as well as additional models.

研究の動機と目的

  • 訓練データやトリガー例のアクセスが制限される状況下でも、深層ニューラルネットワークにおけるバックドア検出という未解決問題に取り組むこと。
  • 実際のデプロイメント環境において、汚染済みモデルとクリーンモデルを信頼性高く区別できるモデルレベルの特性を同定すること。
  • 多様なトリガータイプ、モデルアーキテクチャ、非 IID データ分布に対しても頑健な検出手法を開発すること。
  • 訓練データの監視が現実的でない生産環境に適した、実用的で軽量なバックドア検出を可能にすること。

提案手法

  • 本手法は、汚染済みモデルでは adversarial perturbation が入力間でより容易に転送されるという観察に着目している。
  • 少量の良性入力に対して未指向的攻撃(例:PGD)を用いて adversarial perturbation を生成し、モデルの摂動に対する感受性を調査する。
  • 転送性から得られる特徴量を用いて、クリーンモデルと汚染済みモデルの両方を含む少量のクラスバランスが取れたモデルサブセット上で検出器を訓練する。
  • 摂動の転送性スコアを入力として使用する分類器(例:ロジスティック回帰)を用い、クリーンモデルと汚染済みモデルを区別する。
  • 少量のラベル付きモデルを用いてキャリブレーションを行い、異なるラウンドの TrojAI ベンチマークからの未観測のテストモデルに対して評価する。
  • 攻撃ドメイン(例:フィルターベース vs. ℓ₁)が実際のトリガータイプと一致しなくても有効であり、攻撃タイプ間で一般化性を示す。

実験結果

リサーチクエスチョン

  • RQ1訓練データやトリガー例のアクセスが制限される状況下でも、adversarial perturbation の転送性が、深層ニューラルネットワークにおけるバックドア汚染の信頼性ある指標として機能するか?
  • RQ2多様なトリガータイプやモデルアーキテクチャにおいて、汚染済みモデルとクリーンモデルの間で adversarial perturbation の転送性にどのような差が生じるか?
  • RQ3少量の非 IID モデルサブセットで学習した場合でも、未観測で多様なモデルセットに対して TOP 手法が効果的にバックドアを検出できるか?
  • RQ4訓練データとテストデータの分布シフト(例:TrojAI ベンチマークの異なるラウンド)に対して、TOP 検出器はどの程度頑健か?
  • RQ5非線形分離可能なトリガー(例:Instagram スタイルのフィルター)を含む多様なトリガータイプに対しても、本手法は一般化可能か?

主な発見

  • TOP は、ポリゴントリガーを用いた TrojAI ベンチマーク第3ラウンドにおいて AUC 0.90 を達成し、優れた検出性能を示した。
  • 正例・負例がそれぞれ1つだけの状況でも、AUC 0.80 を超える結果を得ており、最小限の訓練データでも有効であることが示された。
  • 非 IID のクロスラウンド検出においても AUC 約 0.75 を維持し、分布シフトに対して頑健であることが確認された。
  • CIFAR-10 モデルでは、フィルターベース攻撃のみを用いて AUC 0.92 を達成し、ℓ₁ とフィルターアタックの組み合わせでは AUC 0.84 を達成した。
  • トリガータイプにわたる一般化性能が高く、フィルターベース攻撃ではポリゴントリガーを AUC > 0.75 で検出可能であり、ℓ₁ 攻撃ですら、トリガーと不一致であっても検出可能な信号を提供した。
  • クロスラウンド性能は安定しており、AUC スコアは 0.68 から 0.88 の範囲に収まっており、実世界の実用的状況でも耐性があることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。