Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating and Boosting Uncertainty Quantification in Classification

Xiaoyang Huang, Jiancheng Yang|arXiv (Cornell University)|Sep 13, 2019
Anomaly Detection Techniques and Applications参考文献 14被引用数 6
ひとこと要約

本稿では、分類精度に依存しない、しきい値フリーで頑健な不確実性評価(UQ)のための指標であるAUCCCを提案する。この指標は、医療AI分野におけるUQの評価に適している。また、深層アンサンブルの予測を模倣するように自信ヘッドを訓練する知識蒸留に基づく手法である不確実性蒸留(UDist)を導入し、CIFAR-10およびChestX-ray14でベースラインを常に上回る。最大で0.7%のAUCCC向上を達成した。

ABSTRACT

Emergence of artificial intelligence techniques in biomedical applications urges the researchers to pay more attention on the uncertainty quantification (UQ) in machine-assisted medical decision making. For classification tasks, prior studies on UQ are difficult to compare with each other, due to the lack of a unified quantitative evaluation metric. Considering that well-performing UQ models ought to know when the classification models act incorrectly, we design a new evaluation metric, area under Confidence-Classification Characteristic curves (AUCCC), to quantitatively evaluate the performance of the UQ models. AUCCC is threshold-free, robust to perturbation, and insensitive to the classification performance. We evaluate several UQ methods (e.g., max softmax output) with AUCCC to validate its effectiveness. Furthermore, a simple scheme, named Uncertainty Distillation (UDist), is developed to boost the UQ performance, where a confidence model is distilling the confidence estimated by deep ensembles. The proposed method is easy to implement; it consistently outperforms strong baselines on natural and medical image datasets in our experiments.

研究の動機と目的

  • 分類における不確実性評価(UQ)のための統一的で定量的な指標の欠如、特に医療AI分野における課題を解決すること。
  • UQの評価を分類性能から分離することで、異なる手法間の公平な比較を可能にすること。
  • シンプルでスケーラブルな蒸留フレームワークを用いて、自信推定を向上させることで、UQ性能を改善すること。
  • 自然画像および医療画像データセット(分布外一般化を含む)において、提案された評価指標と手法の有効性を検証すること。

提案手法

  • 正確な予測と不正確な予測をそれぞれ正例と負例とみなす、判別的評価フレームワークである自信-分類特性(CCC)分析を提案する。
  • CCC曲線の下側面積としてのAUCCCを導入し、しきい値フリーで微小な摂動に対して頑健であり、分類精度に依存しない指標であることを示す。
  • 深層アンサンブルの自信出力を模倣するように自信ヘッドを訓練する、キャスケードモデルである不確実性蒸留(UDist)を開発する。
  • 温度スケーリングとアンサンブル平均化を用いて、蒸留訓練中の不確実性推定を安定化する。
  • 標準的なトレーニングプロトコルに従い、画像分類およびマルチラベル医療画像(ChestX-ray14)の両方のタスクにこの手法を適用する。
  • 交差エントロピーとブライアスコアをベースライン指標として用いるが、これらが微小な自信の摂動に敏感であることに言及し、AUCCCの導入の必要性を裏付ける。

実験結果

リサーチクエスチョン

  • RQ1分類精度に依存しない、統一的で定量的な指標を開発することは可能か? これにより、異なるモデル間でのUQ性能の公平な評価が可能になるか?
  • RQ2不確実性評価を、頑健でスケーラブルかつ既存のディープラーニングパイプラインと互換性を持つ方法で向上させることは可能か?
  • RQ3深層アンサンブルからの知識蒸留は、アンサンブル自体よりも優れた不確実性推定をもたらすか?
  • RQ4提案手法は、医療画像における分布内キャリブレーションおよび分布外一般化において、どのように性能を発揮するか?

主な発見

  • NIH ChestX-ray14データセットにおいて、UDistはDenseNetに対して0.7%、Deep Ensembleに対して0.17%のAUCCC向上を達成し、不確実性評価の性能向上が一貫して確認された。
  • CIFAR-10対SVHNの比較では、UDistは98.18%のI/O AUROCおよび98.25%のAUCCCを達成し、Deep Ensembleベースラインの97.76%および98.04%を上回った。
  • ChestX-ray14対OCT2017の比較では、UDistは69.42%のI/O AUROCおよび71.77%のAUCCCを達成し、Deep Ensembleベースラインの68.09%および70.61%を上回った。
  • AUCCCはI/O AUROCを常に上回り、精度と自信を別々に評価することで、分布内キャリブレーションをより適切に捉えていることが示された。
  • ベースモデルが過信的であっても、本手法は有効に機能し、不確実性推定における過学習への頑健性を示している。
  • キャスケードモデル構造は効果的ではあるが、マルチラベル設定では特徴の統合が劣化する傾向にあり、入力統合の改善が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。