Skip to main content
QUICK REVIEW

[論文レビュー] Breaking Down Out-of-Distribution Detection: Many Methods Based on OOD Training Data Estimate a Combination of the Same Core Quantities

Julian Bitterwolf, Alexander Meinke|arXiv (Cornell University)|Jun 20, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿は、Outlier Exposure や Energy-Based Models、バックグラウンドクラス学習といった複数の分布外(OOD)検出手法が、すべて同じ根本的なベイジアン意思決定基準を暗黙的に最適化していることを示している。すなわち、分布内データと分布外データの二値分類である。形式は異なっても、同じように学習された場合、これらの手法は類似した性能に収束する。これは、それらの実用的成功が根本的に異なる原理ではなく、同じ潜在的なスコア関数の推定に起因していることを示している。

ABSTRACT

It is an important problem in trustworthy machine learning to recognize out-of-distribution (OOD) inputs which are inputs unrelated to the in-distribution task. Many out-of-distribution detection methods have been suggested in recent years. The goal of this paper is to recognize common objectives as well as to identify the implicit scoring functions of different OOD detection methods. We focus on the sub-class of methods that use surrogate OOD data during training in order to learn an OOD detection score that generalizes to new unseen out-distributions at test time. We show that binary discrimination between in- and (different) out-distributions is equivalent to several distinct formulations of the OOD detection problem. When trained in a shared fashion with a standard classifier, this binary discriminator reaches an OOD detection performance similar to that of Outlier Exposure. Moreover, we show that the confidence loss which is used by Outlier Exposure has an implicit scoring function which differs in a non-trivial fashion from the theoretically optimal scoring function in the case where training and test out-distribution are the same, which again is similar to the one used when training an Energy-Based OOD detector or when adding a background class. In practice, when trained in exactly the same way, all these methods perform similarly.

研究の動機と目的

  • トレーニング中に代替OODデータを用いる多様なOOD検出手法の背後にある共通の理論的基盤を特定すること。
  • 信頼度損失、エネルギーベースモデル、バックグラウンドクラス学習を含む代表的なOOD検出技術の暗黙的なスコア関数を分析すること。
  • 分布内と分布外の間で共通の二値識別器を学習することで、最先端のOOD検出性能に達するかを評価すること。
  • 密度推定手法が理論的には関連しているにもかかわらず、なぜOOD検出にしばしば失敗するのかを明確にすること。
  • 推定手順と背後にあるスコア関数を分離することで、1つのモデルから複数のOOD検出手法をシミュレート可能にする。

提案手法

  • ベイジアン意思決定理論を用いたOOD検出の理論的分析により、二値分類と複数のOOD検出目的との間の同等性を示した。
  • 信頼度損失(Outlier Exposure)およびエネルギーベースモデル、バックグラウンドクラス学習の暗黙的なスコア関数を導出。
  • 標準的な分類器と同時に学習する共通の二値識別器を、分布内データ上で学習し、OOD検出性能を評価。
  • 標準ベンチマーク(CIFAR-10、CIFAR-100、SVHN、LSUN、ImageNet、OpenImages)を用いて、複数の手法間でのOOD検出性能を実験的に比較。
  • 複数回の実行と複数のデータセットにおいて、信頼性を確保するための主評価指標としてAUROCを用いた。
  • 密度推定と一様ノイズに対する識別との同等性を分析し、標準的密度推定器がOOD検出でなぜ失敗するのかを説明。

実験結果

リサーチクエスチョン

  • RQ1代替OODデータを用いる異なるOOD検出手法は、根本的に異なる理論的目的に基づいているのか?
  • RQ2Outlier Exposureで用いられる信頼度損失が最適化している暗黙のスコア関数は何か?
  • RQ3共に学習された二値識別器の性能は、最先端のOOD検出手法と比較してどうか?
  • RQ4理論的には識別タスクと同等であるにもかかわらず、なぜ標準的密度推定手法がOOD検出に失敗するのか?
  • RQ5推定とスコア関数を分離することで、1つのモデルから複数のOOD検出手法をシミュレートできるか?

主な発見

  • Outlier Exposureで用いられる信頼度損失は、学習時とテスト時の分布外分布が同一である場合に、理論的に最適な二値識別器と比較して非最適なスコア関数を暗黙的に最適化している。
  • 分布内と分布外の間で共に学習された二値識別器は、Outlier Exposure やエネルギーベースモデルといった最先端の手法と同等のOOD検出性能を達成している。
  • 評価されたすべての手法—Outlier Exposure、エネルギーベースモデル、バックグラウンドクラス学習—は、同じように学習された場合、同じコアスコア関数を暗黙的に推定しており、これにより類似した実験的性能が説明できる。
  • 密度推定は理論的には分布内と一様ノイズの識別と同等であるが、これが標準的密度推定器がOOD検出で実際には失敗する理由を説明している。
  • 共通の二値識別器ベースラインは、OpenImagesを代替OODデータとして用いた場合、CIFAR-10でAUROC 95.13、CIFAR-100でAUROC 99.55を達成し、多くの専用手法を上回っている。
  • 手法間の性能差は、主に推定効率の違いに起因しており、背後にあるスコア関数の根本的な違いによるものではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。