Skip to main content
QUICK REVIEW

[論文レビュー] A Call to Reflect on Evaluation Practices for Failure Detection in Image Classification

Paul F. Jaeger, Carsten T. Lüth|arXiv (Cornell University)|Nov 28, 2022
Adversarial Robustness in Machine Learning被引用数 18
ひとこと要約

この論文は、画像分類における信頼度スコア関数(CSF)の不正分類検出のための統一された評価フレームワークを提唱し、現在の分類誤り検出、OoD検出、その他のサブフィールドにおける個別的な評価プロトコルが一貫性のない、不完全なベンチマーキングを引き起こしていることを明らかにしている。著者らは大規模な実験的調査を実施し、単純なソフトマックス応答が複雑な手法を上回ることを示しており、既存の評価慣行の欠陥を暴露し、安全なMLシステムの導入を可能にする包括的かつ標準化されたベンチマーキングの必要性を提唱している。

ABSTRACT

Reliable application of machine learning-based decision systems in the wild is one of the major challenges currently investigated by the field. A large portion of established approaches aims to detect erroneous predictions by means of assigning confidence scores. This confidence may be obtained by either quantifying the model's predictive uncertainty, learning explicit scoring functions, or assessing whether the input is in line with the training distribution. Curiously, while these approaches all state to address the same eventual goal of detecting failures of a classifier upon real-life application, they currently constitute largely separated research fields with individual evaluation protocols, which either exclude a substantial part of relevant methods or ignore large parts of relevant failure sources. In this work, we systematically reveal current pitfalls caused by these inconsistencies and derive requirements for a holistic and realistic evaluation of failure detection. To demonstrate the relevance of this unified perspective, we present a large-scale empirical study for the first time enabling benchmarking confidence scoring functions w.r.t all relevant methods and failure sources. The revelation of a simple softmax response baseline as the overall best performing method underlines the drastic shortcomings of current evaluation in the abundance of publicized research on confidence scoring. Code and trained models are at https://github.com/IML-DKFZ/fd-shifts.

研究の動機と目的

  • 分類誤り検出のサブフィールド(例:MisD, OoD-D, SC, PUQ)における評価プロトコルの不一致を特定・是正することにより、公平な比較と進展を妨げる要因を解消すること。
  • 現在の評価慣行が関連する手法や障害要因を除外していることの影響を示し、報告された結果の実用的妥当性と信頼性の低下を明らかにすること。
  • 耐性ベンチマークに類似した包括的かつ統一された評価プロトコルを提唱し、すべての現実的な障害モードにわたる信頼度スコア関数(CSF)の包括的評価を可能にすること。
  • 大規模な実験的調査を通じて、ソフトマックス応答のような単純なベースラインが最も優れた性能を示す実証的証拠を提供すること。

提案手法

  • 分類誤り検出(MisD)、分布外検出(OoD-D)、選択的分類(SC)、予測不確実性評価(PUQ)の4つの障害検出サブフィールドにおける既存の評価プロトコルを体系的に分析・比較する。
  • これらの分散したプロトコルを統合し、すべての関連する障害要因とCSFタイプをカバーする単一で一貫性のあるベンチマークに統合する包括的評価フレームワークを提唱する。
  • CIFAR-10、CIFAR-100、SVHNデータセットを用い、12種の分布シフトにおいて15種のCSFを比較する大規模な実験的調査を実施し、標準化されたトレーニングおよび評価プロトコルを採用する。
  • ソフトマックス応答、マハラノビススコア、最大ログティットスコア(MLS)、ConfidNetを含むCSFを実装・評価し、一貫したデータオーグメンテーションおよびモデル選択戦略を採用する。
  • AUROC_fを主な指標として障害検出性能を評価し、頑健性を確認するためのfail-average-precisionおよびAURCの追加分析も実施する。
  • モデル選択戦略(例:最終エポック vs. 最良エポック)およびハイパーパramータ選択に対するアブレーションスタディを実施し、公平かつ再現可能な比較を保証する。

実験結果

リサーチクエスチョン

  • RQ1なぜ画像分類における障害検出の現在の評価プロトコルは、異なる研究サブフィールド間で一貫性のない、不完全なベンチマーキングを引き起こすのか?
  • RQ2既存の評価プロトコルがどの程度、関連する信頼度スコア関数(CSF)や障害要因を除外しており、実用的妥当性を損なっているのか?
  • RQ3多様な分布シフトと障害モードにおいて、ソフトマックス応答のような単純なベースラインと、複雑で最先端のCSFとの性能はどのように比較されるのか?
  • RQ4OoD-Dタスクの定式化にどのような根本的な欠陥があり、それが実運用環境での分類誤り検出という目的から逸脱しているのか?
  • RQ5公平で包括的かつ現実的なCSFベンチマーキングを可能にする包括的かつ統一された評価プロトコルを設計・検証することは可能か?

主な発見

  • ソフトマックス応答ベースラインは、全テストデータセットおよび分布シフトにおいて、他のすべての信頼度スコア関数を上回り、最高のAUROC_fスコアを達成した。
  • マハラノビススコアおよび最大ログティットスコア(MLS)は強力な性能を示したが、依然として単純なソフトマックスベースラインに劣っていた。
  • エポック選択によるモデル選択(例:最終エポックの使用)は、検証指標に基づく最良エポック選択といったより複雑な戦略を常に上回った。
  • 元のConfidNet設定は、小規模な検証セットのため、極めて不安定な結果を示し、より単純なモデル選択戦略が安定性と性能を向上させた。
  • マハラノビススコアの評価では、実行間での分散が高く、標準偏差が最大で7.86に達しており、報告された結果の不安定性が示された。
  • OoD-Dタスクの定式化は、根本的に障害検出の目的から逸脱しており、分布シフト検出に焦点を当てているため、誤った性能評価を引き起こしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。