Skip to main content
QUICK REVIEW

[論文レビュー] Generating and Detecting True Ambiguity: A Forgotten Danger in DNN Supervision Testing

Michael Weiß, André García Gómez|arXiv (Cornell University)|Jul 21, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、正則化された敵対的オートエンコーダーの潜在空間における勾配誘導型サンプリングを用いて、モデルに依存しない人間によるアノテーション付きの曖昧な画像を生成する新しい手法AmbiGuessを紹介する。主な貢献は、DNN監視者を評価するための包括的かつ実証的な研究であり、監視者が特定の不確実性タイプを検出する能力に差があることを示している。具体的には、ソフトマックスベースの手法は曖昧性に対しては優れているが、敵対的入力や汚染された入力に対しては弱く、OOD検出器は真の曖昧性に対しては性能が低い。

ABSTRACT

Deep Neural Networks (DNNs) are becoming a crucial component of modern software systems, but they are prone to fail under conditions that are different from the ones observed during training (out-of-distribution inputs) or on inputs that are truly ambiguous, i.e., inputs that admit multiple classes with nonzero probability in their labels. Recent work proposed DNN supervisors to detect high-uncertainty inputs before their possible misclassification leads to any harm. To test and compare the capabilities of DNN supervisors, researchers proposed test generation techniques, to focus the testing effort on high-uncertainty inputs that should be recognized as anomalous by supervisors. However, existing test generators aim to produce out-of-distribution inputs. No existing model- and supervisor independent technique targets the generation of truly ambiguous test inputs, i.e., inputs that admit multiple classes according to expert human judgment. In this paper, we propose a novel way to generate ambiguous inputs to test DNN supervisors and used it to empirically compare several existing supervisor techniques. In particular, we propose AmbiGuess to generate ambiguous samples for image classification problems. AmbiGuess is based on gradient-guided sampling in the latent space of a regularized adversarial autoencoder. Moreover, we conducted what is -- to the best of our knowledge -- the most extensive comparative study of DNN supervisors, considering their capabilities to detect 4 distinct types of high-uncertainty inputs, including truly ambiguous ones. We find that the tested supervisors' capabilities are complementary: Those best suited to detect true ambiguity perform worse on invalid, out-of-distribution and adversarial inputs and vice-versa.

研究の動機と目的

  • DNN監視者を評価するための標準的で人間が検証済みの曇ったテストデータの不足に取り組むこと、特に確率的不確実性(aleatoric uncertainty)に対して。
  • 既存のテスト生成技術が分布外(OOD)入力に焦点を当てているが、複数のラベルが妥当な真の曇った入力を無視している点を特定すること。
  • DNNや監視者に依存しないアプローチで、画像分類タスク用に多様でラベル付けされた曇った画像を生成すること。
  • これまでで最も包括的なDNN監視者の比較評価を実施し、4つの明確に異なる高不確実性入力タイプ(名目、曇り、敵対的、汚染済み)の検出能力を評価すること。
  • MNISTおよびFashion-MNIST用に事前にコンパイル済みの曇ったデータセット2つを公開することで、新しいDNN監視者の公平かつ信頼性の高い評価を可能にすること。

提案手法

  • 正則化された敵対的オートエンコーダーの潜在空間における勾配誘導型サンプリング技術として、AmbiGuessを提案する。
  • クラス条件付き勾配を用いて、意味的構造を保持しつつ、曇り領域への制御された摂動を可能にする潜在空間を活用する。
  • 人間の判断と統計的整合性によるラベル多様性の検証により、生成されたサンプルが仮想のオラクル(例:人間の専門家)にとって曇っていることを保証する。
  • MNISTおよびFashion-MNISTに基づいて、人間が検証済みの曇ったラベルを備えた2つのデータセット(AmbiMNISTおよびAmbiFashionMNIST)を生成する。
  • ラベルエントロピー、アノテーター間一致度、モデルの信頼度、多様性といった4つの指標を用いて、曇りとデータ品質を検証する。
  • 標準的な指標(AUC-ROC、F1スコアなど)を用いて、16種類のDNN監視者を4つの入力タイプ(名目、曇り、敵対的、汚染済み)で評価する。

実験結果

リサーチクエスチョン

  • RQ1画像分類タスクにおいて、DNNや監視者に依存しない方法で、多様でラベル付けされ、人間が検証済みの曇った画像を生成することは可能か?
  • RQ2既存のDNN監視者は、敵対的入力、汚染された入力、無効な入力といった他の不確実性タイプと比較して、真の曇った入力を検出する能力はどの程度か?
  • RQ3異なる監視者技術には相補的な検出能力があるのか?一部の技術は曇り検出に優れているが、他の不確実性タイプでは性能が劣るのか?
  • RQ4ソフトマックスベースの監視者(例:MC-Dropout、アンサンブル)は、OOD検出ベースの監視者に比べて、真の曇りを検出する能力で顕著に優れているのか?
  • RQ5提案されたAmbiGuessによって生成されたデータセットは、確率的不確実性検出のための新しいDNN監視者を公平かつ信頼性高く評価するために使用可能か?

主な発見

  • AmbiGuessは、ラベルエントロピーとアノテーター間一致度を含む4つの定量的曇り指標において、唯一の既存曇りデータセット(AmbiguousMNIST)を著しく上回った。
  • ソフトマックスベースの監視者(例:MC-Dropout、アンサンブル)は、曇り入力に対して高いAUC-ROCスコア(例:>0.95)を達成したが、敵対的および汚染された入力に対しては性能が低く、一部のケースではAUC-ROCが0.60未満であった。
  • OOD検出ベースの監視者(例:Surprise Adequacy、オートエンコーダー基盤)は、敵対的および汚染された入力に対して優れた性能(AUC-ROC >0.90)を示したが、分布内での曇り入力を検出できず、AUC-ROCが0.55未満であった。
  • 研究では明確なトレードオフが明らかになった:ある種の不確実性(例:曇り)に最適化された監視者は、他のタイプ(例:OOD)に対しては効果が低く、相補的な検出能力があることが示された。
  • 4種類の異なるDNNアーキテクチャ(例:LeNet、VGG風、ResNet)においても結果が一貫しており、アーキテクチャの違いに関係なく、研究の結果が頑健であることが確認された。
  • 著者らは、許可が緩いライセンスを適用したオープンソースの2つの曇りデータセット(AmbiMNISTおよびAmbiFashionMNIST)を公開し、今後の研究やツール評価を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。