Skip to main content
QUICK REVIEW

[論文レビュー] Improving the repeatability of deep learning models with Monte Carlo dropout

Andréanne Lemay, Katharina Hoebel|arXiv (Cornell University)|Feb 15, 2022
Artificial Intelligence in Healthcare and Education被引用数 5
ひとこと要約

本稿では、医療画像分類における深層学習モデルの再現性を向上させるために、推論時におけるモンテカルロドロップアウト(MCドロップアウト)の使用を提案する。ドロップアウトを活性化した複数回の順方向伝搬をサンプリングすることで、同じ患者の繰り返し画像における予測ばらつきが低減され、95%差の許容範囲において再現性が平均16ポイント向上し、キャリブレーションの向上も見られた。特に二値分類、多値分類、順序尺度分類タスクにおいて、精度の損失を最小限に抑えつつ顕著な効果を示した。

ABSTRACT

The integration of artificial intelligence into clinical workflows requires reliable and robust models. Repeatability is a key attribute of model robustness. Repeatable models output predictions with low variation during independent tests carried out under similar conditions. During model development and evaluation, much attention is given to classification performance while model repeatability is rarely assessed, leading to the development of models that are unusable in clinical practice. In this work, we evaluate the repeatability of four model types (binary classification, multi-class classification, ordinal classification, and regression) on images that were acquired from the same patient during the same visit. We study the performance of binary, multi-class, ordinal, and regression models on four medical image classification tasks from public and private datasets: knee osteoarthritis, cervical cancer screening, breast density estimation, and retinopathy of prematurity. Repeatability is measured and compared on ResNet and DenseNet architectures. Moreover, we assess the impact of sampling Monte Carlo dropout predictions at test time on classification performance and repeatability. Leveraging Monte Carlo predictions significantly increased repeatability for all tasks on the binary, multi-class, and ordinal models leading to an average reduction of the 95\% limits of agreement by 16% points and of the disagreement rate by 7% points. The classification accuracy improved in most settings along with the repeatability. Our results suggest that beyond about 20 Monte Carlo iterations, there is no further gain in repeatability. In addition to the higher test-retest agreement, Monte Carlo predictions were better calibrated which leads to output probabilities reflecting more accurately the true likelihood of being correctly classified.

研究の動機と目的

  • 臨床的深層学習において意思決定支援の信頼性に不可欠であるにもかかわらず、モデルの再現性に対する関心の欠如という深刻な問題に対処すること。
  • 推論時におけるモンテカルロドロップアウトが、多様な医療画像タスクおよびモデルタイプにおいて再現性を向上させるかどうかを評価すること。
  • ResNetおよびDenseNetアーキテクチャの両方において、MCドロップアウトが分類性能、再現性、キャリブレーションに与える影響を比較すること。
  • 再現性を最大化するための最適なMCサンプリング反復回数を特定すること、収益の逓減が生じない範囲で評価すること。

提案手法

  • 同じ入力画像に対して複数回の順方向伝搬を実行する際、推論時にドロップアウト層を活性化することでモンテカルロドロップアウトを適用する。
  • MC予測の平均と分散を用いて不確実性を推定し、予測の安定性を向上させる。
  • 同一患者からの画像ペアを用いたBland-Altmanプロットを用い、95%差の許容範囲(LoA)および分類不一致率を測定することで再現性を評価する。
  • 予測確率が真の分類確率を的確に反映しているかどうかを評価するため、Brierスコアを用いてモデルのキャリブレーションを評価する。
  • 膝の変形性関節症、子宮頸がんスクリーニング、乳腺密度、早産性網膜症の4つの医療画像タスクにおいて、二値分類、多値分類、順序尺度分類、回帰の4つのモデルタイプを評価する。
  • 非パラメトリックなLoAおよびブートストラップ法を用いたt検定を用いて統計的有意性を評価し、1~50回のMC反復におけるモデル性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1推論時におけるモンテカルロドロップアウトは、多様な医療画像分類タスクにおける深層学習モデルの再現性を向上させるか?
  • RQ2MCドロップアウトは再現性に加え、分類精度およびキャリブレーションにどのような影響を与えるか?
  • RQ3再現性を最大化するための最適なMCサンプリング反復回数は何か?収益の逓減が生じない範囲で評価すること。
  • RQ4異なるモデルアーキテクチャ(ResNet、DenseNet)およびモデルタイプ(二値分類、多値分類、順序尺度分類、回帰)はMCドロップアウトに対してどのように反応するか?
  • RQ5同じ患者の画像を類似した条件下で再テストした際、MCドロップアウトは予測ばらつきをどの程度低減するか?

主な発見

  • モンテカルロドロップアウトは、すべてのタスクで再現性を顕著に向上させ、95%差の許容範囲を平均16ポイント低減した。
  • MCドロップアウトを用いることで分類不一致率が7ポイント低下し、繰り返し画像における予測の一貫性が向上した。
  • 20回を超えるMC反復では、再現性のさらなる向上が観察されず、収益の逓減が生じた。
  • MCドロップアウトはモデルのキャリブレーションを向上させ、予測確率が正しい分類の真の確率をより的確に反映するようになった。
  • 二値分類、多値分類、順序尺度分類モデルでは、再現性および精度の両面で一貫した改善が見られたが、回帰モデルでは一貫した改善が認められなかった。
  • 本手法は、さまざまなアーキテクチャ(ResNet18、ResNet50、DenseNet121)で有効であり、すべてのモデルタイプに容易に適用可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。