Skip to main content
QUICK REVIEW

[論文レビュー] Towards safe deep learning: accurately quantifying biomarker uncertainty in neural network predictions

Zach Eaton-Rosen, Felix Bragman|arXiv (Cornell University)|Jun 22, 2018
Radiomics and Machine Learning in Medical Imaging参考文献 7被引用数 9
ひとこと要約

本稿では、医用画像分類における不確実性を定量化するために、モンテカルロドロップアウトを用いたベイジアンディープラーニングの応用を提案している。ボクセル単位の不確実性を、バイオマーカー測定に適した良好にキャリブレーションされたボリュメトリック信頼区間へと変換することで、深層学習システムが腫瘍体積の推定値に信頼性のある誤差範囲を提示できるようになった。これにより、臨床的安心性が向上し、ノイズや分布シフトに対してより頑健な性能が得られる。

ABSTRACT

Automated medical image segmentation, specifically using deep learning, has shown outstanding performance in semantic segmentation tasks. However, these methods rarely quantify their uncertainty, which may lead to errors in downstream analysis. In this work we propose to use Bayesian neural networks to quantify uncertainty within the domain of semantic segmentation. We also propose a method to convert voxel-wise segmentation uncertainty into volumetric uncertainty, and calibrate the accuracy and reliability of confidence intervals of derived measurements. When applied to a tumour volume estimation application, we demonstrate that by using such modelling of uncertainty, deep learning systems can be made to report volume estimates with well-calibrated error-bars, making them safer for clinical use. We also show that the uncertainty estimates extrapolate to unseen data, and that the confidence intervals are robust in the presence of artificial noise. This could be used to provide a form of quality control and quality assurance, and may permit further adoption of deep learning tools in the clinic.

研究の動機と目的

  • 深層学習に基づく医用画像分類における不確実性評価の欠如が、バイオマーカー測定における臨床的誤差を引き起こすリスクがあることに対処すること。
  • ボクセル単位の分類不確実性を、腫瘍体積などの後続バイオマーカーに適した良好にキャリブレーションされたボリュメトリック信頼区間へと変換する手法を開発すること。
  • ノイズや分布外の入力が含まれるなど、データ品質が変動する状況下でも、不確実性推定が信頼性を持ち、良好にキャリブレーションされることを保証すること。
  • ネットワークアーキテクチャの変更なしに、行動可能な不確実性推定を提供することで、臨床プロトコルへの安全な導入を可能にすること。

提案手法

  • ハイ・レゾリューションネットワークアーキテクチャにモンテカルロドロップアウトを適用し、複数回の順方向伝搬による予測不確実性を近似的に推定するベイジアン推論を実現する。
  • 被験者1人あたり200回の確率的順方向伝搬を統合し、各クラス(例:「全腫瘍」「コア」「活性」腫瘍)の分類体積の分布を生成する。
  • 予測体積の経験的累積分布関数(CDF)を構築し、パーセンタイルに基づく信頼区間を導出する。
  • アフィンキャリブレーションを適用して信頼区間をスケーリングし、被験者全体で真の体積をカバーする割合を向上させる。
  • 入力画像にガウスノイズを注入することで耐性を検証し、真の体積が信頼区間内に収まるかどうかを評価する。
  • アンサンブル手法やアーキテクチャ変更なしに、1つのトレーニング済みモデルとドロップアウトを用いて不確実性推定を生成する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークにおけるモンテカルロドロップアウトは、医用画像分類に対して意味的で良好にキャリブレーションされた不確実性推定を生成できるか?
  • RQ2ボクセル単位の不確実性は、腫瘍体積などのバイオマーカー測定に適した信頼性の高いボリュメトリック信頼区間に効果的に集約できるか?
  • RQ3ガウスノイズのようなデータ摂動が加わった状況でも、得られた信頼区間は真の体積をどれだけよくカバーするか?
  • RQ4臨床現場において、不確実性推定は画像品質やデータ信頼性の代理指標として機能できるか?

主な発見

  • 1つの確率的ネットワークからの200回の体積予測の元の分布は、真の体積を十分な回数にわたって含んでいなかったため、初期のキャリブレーションが不十分であることが示された。
  • アフィンキャリブレーションを適用した後、コア領域の95%信頼区間は、真の体積をはるかに頻繁にカバーするよう著しく改善された。
  • ガウスノイズのレベルが高くなるに従って、キャリブレーション済みの信頼区間も依然として真の体積を含んでおり、データ品質の低下に対しても頑健であることが示された。
  • 本手法は、未学習のデータに対しても不確実性を適切に外挿でき、人工的なノイズに対しても信頼性を維持した。これは、臨床プロトコルにおける品質管理に有用である可能性を示している。
  • 本手法は、通常の推論にドロップアウトを適用するのみで、最小限の計算コストで良好にキャリブレーションされた不確実性報告を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。