Skip to main content
QUICK REVIEW

[論文レビュー] Estimating Uncertainty in Neural Networks for Cardiac MRI Segmentation: A Benchmark Study

Matthew Ng, Fumin Guo|arXiv (Cornell University)|Dec 31, 2020
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

このベンチマーク研究では、心臓MRI画像分類のU-Netモデルにおける不確実性推定手法—ベイジアンニューラルネットワーク(BBB)、モンテカルロドロップアウト(MCD)、ディープアンサンブル(Ensemble)、ストキャスティックスペクトル正規化(SSN)—を評価する。結果として、BBBおよびMCDはノイズおよび歪み下でも信頼性の高い不確実性評価と高い分類精度を示した。一方、ディープアンサンブルは特に分布外の状況において最も高いロバストネスを示した。

ABSTRACT

Objective: Convolutional neural networks (CNNs) have demonstrated promise in automated cardiac magnetic resonance image segmentation. However, when using CNNs in a large real-world dataset, it is important to quantify segmentation uncertainty and identify segmentations which could be problematic. In this work, we performed a systematic study of Bayesian and non-Bayesian methods for estimating uncertainty in segmentation neural networks. Methods: We evaluated Bayes by Backprop, Monte Carlo Dropout, Deep Ensembles, and Stochastic Segmentation Networks in terms of segmentation accuracy, probability calibration, uncertainty on out-of-distribution images, and segmentation quality control. Results: We observed that Deep Ensembles outperformed the other methods except for images with heavy noise and blurring distortions. We showed that Bayes by Backprop is more robust to noise distortions while Stochastic Segmentation Networks are more resistant to blurring distortions. For segmentation quality control, we showed that segmentation uncertainty is correlated with segmentation accuracy for all the methods. With the incorporation of uncertainty estimates, we were able to reduce the percentage of poor segmentation to 5% by flagging 31--48% of the most uncertain segmentations for manual review, substantially lower than random review without using neural network uncertainty (reviewing 75--78% of all images). Conclusion: This work provides a comprehensive evaluation of uncertainty estimation methods and showed that Deep Ensembles outperformed other methods in most cases. Significance: Neural network uncertainty measures can help identify potentially inaccurate segmentations and alert users for manual review.

研究の動機と目的

  • 深層学習モデルを用いた心臓MRI画像分類における複数の不確実性推定手法の性能を評価・比較すること。
  • ノイズ、ぼかし、幾何変換などのさまざまな画像歪み下でも、異なる不確実性手法が分類精度をどの程度維持できるかを評価すること。
  • 予測不確実性指標(例:エントロピー、相互情報量)と実際の分類誤差との相関関係を調査すること。
  • 臨床画像シナリオにおいて、最も信頼性が高くキャリブレーションされた不確実性推定を提供する手法を特定すること。
  • 実世界の心臓MRI画像分類タスクにおける、各不確実性手法の計算コストおよび推論効率をベンチマークすること。

提案手法

  • ベイジアンニューラルネットワーク(BBB)、ドロップアウト率0.1および0.5を用いたモンテカルロドロップアウト(MCD)、10モデルのディープアンサンブル(Ensemble)、ストキャスティックスペクトル正規化(SSN)を含む5つの不確実性推定手法を用いたU-Netアーキテクチャを訓練した。
  • 耐性を高めるために、トレーニング中にランダムな回転、平行移動、スケーリングを含むデータオーグメンテーションを適用した。
  • Adam最適化アルゴリズムを用い、学習率をコサインスケジュールで減少:初期値LR = 1e-4、30エポック後に1e-5に低下。
  • 画像前処理として、160×160に中央クロップし、データセット全体の平均および分散を用いて正規化した。
  • 制御された歪みを加えたテスト画像に対して、予測エントロピー、相互情報量、不確実性に配慮した指標(Dice_WS、ASSD_WS)を用いて不確実性を測定した。
  • UK BiobankおよびACDCデータセット上でモデル性能を評価し、UKBBからACDCへのゼロショット転送も実施した。

実験結果

リサーチクエスチョン

  • RQ1ノイズが増加する条件下で、異なる不確実性推定手法(BBB、MCD、Ensemble、SSN)の分類精度はどのように比較されるか?
  • RQ2歪みを加えた心臓MRIスキャンにおいて、予測不確実性(例:エントロピー、相互情報量)が実際の分類誤差とどの程度相関しているか?
  • RQ3UK BiobankからACDCデータセットへの一般化において、どの不確実性手法が最も信頼性が高くキャリブレーションされた不確実性推定を提供するか?
  • RQ4推論時間およびトレーニング時間の観点から、各手法における不確実性推定の計算コストはどのように変化するか?
  • RQ5不確実性推定の使用により、ぼかしや幾何変形などの分布外の歪みに対するモデルのロバストネスが向上するか?

主な発見

  • ディープアンサンブルは、綺麗なUK Biobank画像において、左室(LV)分類の中央値Diceスコア(0.965、93.6–98.3)が最も高く、ASSD(0.74、0.43–1.12)が最小であり、通常のU-Netおよび他の手法を上回った。
  • BBBおよびMCD-0.1はノイズおよびぼかし下でも優れた耐性を示し、通常のU-Netに比べてより高いピxls単位の精度(例:BBB:ノイズレベル1で0.9929)およびDiceスコア(例:BBB:ノイズレベル1で0.947)を維持した。
  • 相互情報量(MI)は歪みレベルが高くなるにつれて顕著に増加した—例:SSNでは、UKBBからUKBB→ACDCに至るまで、0.32×10⁻³から6.89×10⁻³に上昇—不確実性と劣化の強い相関を示した。
  • ACDCデータセットでは、BBBおよびMCD-0.1が相互情報量とASSDの間で最も高いスピアマン相関(r > 0.7)を示し、信頼性の高い不確実性キャリブレーションを確認した。
  • SSNは高い不確実性値(例:UKBB→ACDCで6.89×10⁻³のMI)を生成したが、分類精度は最悪で、LVのDiceは0.961にとどまり、不確実性推定において過信している可能性を示唆した。
  • 統計的検定により、顕著な性能差が確認された:BBB vs. 通常のU-Net(p < 0.0001)、MCD-0.1 vs. MCD-0.5(p < 0.0001)、Ensemble vs. SSN(p < 0.0001)—各手法の信頼性の差が明確に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。