Skip to main content
QUICK REVIEW

[論文レビュー] Addressing Failure Prediction by Learning Model Confidence

Charles Corbière, Nicolas Thome|arXiv (Cornell University)|Oct 1, 2019
Adversarial Robustness in Machine Learning参考文献 42被引用数 107
ひとこと要約

この論文は True Class Probability (TCP) を分類・セマンティックセグメンテーションにおける故障予測の信頼度指標として導入し、ConfidNet という学習型信頼度予測器を提案します。これにより MCP やベイズ/アンサンブルのベースラインを複数のデータセットで上回ります。

ABSTRACT

Assessing reliably the confidence of a deep neural network and predicting its failures is of primary importance for the practical deployment of these models. In this paper, we propose a new target criterion for model confidence, corresponding to the True Class Probability (TCP). We show how using the TCP is more suited than relying on the classic Maximum Class Probability (MCP). We provide in addition theoretical guarantees for TCP in the context of failure prediction. Since the true class is by essence unknown at test time, we propose to learn TCP criterion on the training set, introducing a specific learning scheme adapted to this context. Extensive experiments are conducted for validating the relevance of the proposed approach. We study various network architectures, small and large scale datasets for image classification and semantic segmentation. We show that our approach consistently outperforms several strong methods, from MCP to Bayesian uncertainty, as well as recent approaches specifically designed for failure prediction.

研究の動機と目的

  • 実世界の応用で深層ネットワークの故障予測を信頼できるものにする動機付け。
  • 理論的根拠に基づく信頼度指標として True Class Probability (TCP) の提案。
  • 固定された分類器の上に構築された専用ニューラルネットワーク(ConfidNet)を用いて TCP ベースの信頼度スコアを学習。
  • 多様なデータセットとアーキテクチャにおいて TCP/ConfidNet が MCP、MCDropout、Trust Score より実データで性能を向上させることを実証。

提案手法

  • 入力とモデル重みに対して真のクラスの確率として TCP を定義し、正例/誤例の予測の理論的保証を導出する。
  • 固定分類器の上に構築された、L2 損失を用いて c*(x,y*) = P(Y=y*|w,x) に回帰する信頼度ネットワーク ConfidNet を導入。
  • 正規化バリアント TCP^r = P(Y=y*|w,x)/P(Y=ŷ|w,x) を任意に用い、学習ダイナミクスを比較。
  • 2 段階の訓練方式を採用:分類器を凍結した状態で ConfidNet を訓練し、その後、信頼度推定のための共有エンコーダを追加で微調整することも検討。
  • 様々なアーキテクチャとデータセット(MNIST、SVHN、CIFAR-10/100、CamVid)を対象に、AUPR-Error、AUPR-Success、FPR@TPR95、AUROC で評価。

実験結果

リサーチクエスチョン

  • RQ1TCP が深層分類器に対する MCP より信頼性の高い故障関連シグナルを提供できるか。
  • RQ2TCP ベースの信頼度予測器(ConfidNet)の学習が画像分類およびセマンティックセグメンテーションの故障検出を改善するか。
  • RQ3TCP およびその正規化 variant TCP^r が MCP、ベイズ法、距離ベーススコア(Trust Score)と比較して故障のランキングおよびキャリブレーションにどう影響するか。
  • RQ4学習スキームの選択(ConvNet エンコーダの訓練、損失タイプ、データ割り当て)が ConfidNet の性能に与える影響。
  • RQ5TCP ベースの手法はデータセットサイズとモデルの複雑さに対して堅牢か。

主な発見

  • TCP ベースのランキングは正例と誤例の分離性を向上させ、故障検出を改善する。
  • ConfidNet は MNIST、SVHN、CIFAR-10/100、CamVid の各データセットで MCP、MCDropout、Trust Score を一貫して上回り、AUPR-Error および関連指標で優位。
  • ConfidNet の訓練後に ConvNet エンコーダを微調整すると、ベースの ConfidNet に対して追加の利益(約1–2ポイント)が得られる。
  • 多くのデータセットにおいて訓練データでの ConfidNet の方が検証データで訓練する場合より良好な性能を示すことが多く、データセット特性に起因する例外あり。
  • TCP での学習(BCE や TCP^r と比較して)には特に大規模データセットで堅牢な改善が見られ、TCP^r は一部の大規模セマンティックセグメンテーションタスクで利点を提供。
  • ConfidNet は高カバレッジ時に選択的分類(リスク-カバレッジ)挙動が好ましく、重要な故障の特定を改善する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。