Skip to main content
QUICK REVIEW

[論文レビュー] A General Framework For Detecting Anomalous Inputs to DNN Classifiers

Jayaram Raghuram, Varun Chandrasekaran|arXiv (Cornell University)|Jul 29, 2020
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿では、DNN分類器における敵対的入力および分布外(OOD)入力を、複数の内部層表現における統計的検定を活用することで、一般化された教師なしフレームワークJTLAを提案する。p値推定とフィッシャーの方法による集約といった、原理的かつ設定可能なコンponentsを用い、適応的攻撃に対して優れた耐性を示し、CIFAR-10、SVHN、MNISTのデータセットにおいても、特に偽陽性率が低い条件下で優れた性能を発揮する。

ABSTRACT

Detecting anomalous inputs, such as adversarial and out-of-distribution (OOD) inputs, is critical for classifiers (including deep neural networks or DNNs) deployed in real-world applications. While prior works have proposed various methods to detect such anomalous samples using information from the internal layer representations of a DNN, there is a lack of consensus on a principled approach for the different components of such a detection method. As a result, often heuristic and one-off methods are applied for different aspects of this problem. We propose an unsupervised anomaly detection framework based on the internal DNN layer representations in the form of a meta-algorithm with configurable components. We proceed to propose specific instantiations for each component of the meta-algorithm based on ideas grounded in statistical testing and anomaly detection. We evaluate the proposed methods on well-known image classification datasets with strong adversarial attacks and OOD inputs, including an adaptive attack that uses the internal layer representations of the DNN (often not considered in prior work). Comparisons with five recently-proposed competing detection methods demonstrates the effectiveness of our method in detecting adversarial and OOD inputs.

研究の動機と目的

  • DNN分類器における異常入力(敵対的およびOOD)を、内部層表現を用いて、原理的かつ統合的なフレームワークとして検出するための課題に対処すること。
  • 既存手法の限界、すなわちラベル付きの異常データに依存すること、適応的攻撃への一般化性の低さ、多層情報の最適でない利用を克服すること。
  • 異常検出のためのテスト統計量、集約法、スコアリング手法の原理的選択と組み合わせを可能にする、教師なしでモジュラーなフレームワークを開発すること。
  • 層表現に基づく検出メカニズムを標的とする防御に配慮した新たな敵対的攻撃に対して、フレームワークの評価を行うこと。
  • 特に偽陽性率が制限された現実的な運用条件下で、多様なデータセットおよび攻撃タイプにおいて、強固な性能を示すこと。

提案手法

  • フレームワークJTLAは、設定可能なコンponents(テスト統計量、p値推定、集約法、意思決定閾値)を持つメタアルゴリズムとして構造化されている。
  • DNN層表現における統計的仮説検定から得られるp値を用い、異常度の度合いを定量化する。p値はカーネル密度推定(LPE)または経験的手法により推定される。
  • 異常は、フィッシャーの方法または算術平均を用いて、複数の層におけるp値を統合することで検出され、多層パターンの共同分析が可能になる。
  • 本手法は教師なしである。異常サンプルの学習を必要とせず、推論時にはクリーンな入力の分布のみに依存する。
  • 層表現を重点的に分析することで、検出に気づかれにくくないよう、適応的攻撃に対しても耐性を持つように設計されている。
  • 特に、クラス固有の特徴を利用する攻撃に対して感受性を高めるために、層表現のクラス条件付き分析を組み込んでいる。

実験結果

リサーチクエスチョン

  • RQ1DNN層表現における統計的検定に基づく一般化された教師なしフレームワークは、敵対的およびOOD入力の検出において、既存手法を上回ることができるか?
  • RQ2複数の層表現の共同分析は、単一層または出力のみに依存する手法と比較して、検出の耐性をどのように向上させるか?
  • RQ3本フレームワークは、検出を回避することを目的とした、未知の適応的敵対的攻撃にもどの程度一般化可能か?
  • RQ4p値推定法および集約戦略の違いが、検出性能および計算効率に与える影響はどの程度か?
  • RQ5層表現のクラス条件付き性質を組み込むことで、特に高信頼度の敵対的攻撃において、検出精度が向上するか?

主な発見

  • CIFAR-10では、pAUC-0.2の観点で、適応的攻撃を含め、多数の攻撃において、すべての比較手法を上回る性能を示し、優れた一般化性能を確認した。
  • SVHNでは、JTLAは強力な性能を維持しており、aK-LPEバージョンが適応的攻撃においてマハラノビス距離法を上回った。これは、防御に配慮した敵対的攻撃に対しても耐性があることを示している。
  • MNISTでは、ロジットの特徴が顕著なため、OddsおよびTrustが一部の攻撃でJTLAを上回ったが、aK-LPEバージョンは適応的攻撃においても競争力があり、特にフィッシャーの方法を回避することを目的とした攻撃に対し、優れた性能を示した。
  • JTLAのaK-LPEバージョンは、適応的攻撃に対して優れた耐性を示しており、p値推定法が操作されにくく、攻撃に左右されにくいことが示唆された。
  • JTLAは、CIFAR-10で1フォールドあたり2.18分という低ランタイムを維持しており、多数のサンプリングや交差検証を要するOddsやLIDといった計算コストの高い手法を上回った。
  • フレームワークのモジュラー設計により、マハラノビス距離法やLIDといった先行手法を統合し、統計的根拠に基づいた改善を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。