Skip to main content
QUICK REVIEW

[論文レビュー] Natural and Adversarial Error Detection using Invariance to Image Transformations

Yuval Bahat, Michal Irani|arXiv (Cornell University)|Feb 1, 2019
Adversarial Robustness in Machine Learning参考文献 20被引用数 14
ひとこと要約

本論文は、単純な画像変換(例:水平反転、コントラスト変更)における分類器の不変性を活用することで、自然な誤分類と敵対的誤分類の両方を統一的かつ即座に検出するフレームワークを提案する。出力の不安定性を変換済みと元の予測の間のKLダイバージェンスで測定することで、最先端の性能を達成しており、MLPを組み込んだバージョンは、強力な既知の検出器攻撃に対しても、従来手法を上回る。

ABSTRACT

We propose an approach to distinguish between correct and incorrect image classifications. Our approach can detect misclassifications which either occur $\it{unintentionally}$ ("natural errors"), or due to $\it{intentional~adversarial~attacks}$ ("adversarial errors"), both in a single $\it{unified~framework}$. Our approach is based on the observation that correctly classified images tend to exhibit robust and consistent classifications under certain image transformations (e.g., horizontal flip, small image translation, etc.). In contrast, incorrectly classified images (whether due to adversarial errors or natural errors) tend to exhibit large variations in classification results under such transformations. Our approach does not require any modifications or retraining of the classifier, hence can be applied to any pre-trained classifier. We further use state of the art targeted adversarial attacks to demonstrate that even when the adversary has full knowledge of our method, the adversarial distortion needed for bypassing our detector is $\it{no~longer~imperceptible~to~the~human~eye}$. Our approach obtains state-of-the-art results compared to previous adversarial detection methods, surpassing them by a large margin.

研究の動機と目的

  • 医療や自動運転などの安全が求められる応用分野において、深層学習モデルの誤分類を検出するという、極めて重要な課題に取り組むこと。
  • 自然誤り(意図しない誤分類)と敵対的誤り(意図的に作成されたもの)の両方を、一つのフレームワークで統合的に検出すること。
  • 攻撃者が検出器の詳細を完全に把握している状況(既知の検出器攻撃)であっても、依然として効果を発揮する検出手法を開発すること。
  • 事前学習済み分類器の再訓練や構造的変更を一切行わず、広範な応用が可能な検出器を構築すること。

提案手法

  • 本手法は、入力画像に単純な画像変換(例:水平反転、微小な平行移動、ガンマ補正)を適用し、分類器の出力の安定性を評価する。
  • 各変換済み画像に対して、モデルのソフトマックス出力を元の出力と比較し、出力の不安定性をKullback-Leibler(KL)ダイバージェンスで定量化する。
  • 高いKLダイバージェンススコアは、出力の不安定性を示しており、自然要因または敵対的要因による誤分類の可能性を示唆する。
  • 基本的なKLスコアの性能を向上させるために、変換に基づく特徴量を用いて多層パーセプトロン(MLP)を訓練する。
  • 検出器は、事前学習済み分類器に対して後から適用可能であり、再訓練やアーキテクチャの変更を一切必要としない。
  • 未知の検出器(UD)および既知の検出器(KD)攻撃シナリオの両方で、特に強力なCarlini & Wagner(C&W)攻撃を含めて評価されている。

実験結果

リサーチクエスチョン

  • RQ1単純な画像変換における分類器出力の不変性は、誤りの種別に関係なく、正しく分類されたものと誤って分類されたものを信頼性高く区別できるか?
  • RQ2攻撃者が検出器の詳細を完全に把握している(既知の検出器状況)場合でも、変換不変性に基づく検出手法は依然として有効に機能するか?
  • RQ3MLPを用いて基本的なKLダイバージェンススコアを向上させることで、自然誤りおよび敵対的誤りの両方の検出性能が向上するか?
  • RQ4多様なデータセットおよび攻撃タイプにおいて、本手法は最先端の検出技術と比較して、耐性およびAUROCの観点で優れているか?

主な発見

  • MLPを統合した検出器を用いることで、ImageNet(Top-1)では0.875、Top-5では0.884という最先端のAUROCを達成し、MSRベースライン(それぞれ0.842および0.806)を上回った。
  • CIFAR-100では、AT(敵対的訓練)設定下でMLPベースの検出器が0.869のAUROCを達成し、SOTAのDBC手法(0.858)および他のベースラインを上回った。
  • C&W攻撃を用いた最も挑戦的な既知の検出器(KD)攻撃状況下でも、攻撃者が目立つ歪みを用いる必要が生じ、敵対的例の不審さが低下する。
  • KLダイバージェンススコアそのものでも、STL-10およびCIFAR-100でMSRおよびドロップアウトベースラインを上回っており、変換不変性が検出の代理指標として有効であることが示された。
  • 本手法は、ImageNet、CIFAR-100、STL-10といった多様なデータセットおよび分類器タイプ(敵対的損失でファインチューニングされたものも含む)において、強力な性能を維持した。
  • 検出器は普遍的に適用可能である:事前学習済み分類器の再訓練や構造的変更を一切不要とし、即座に統合可能なプラグアンドプレイの展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。