Skip to main content
QUICK REVIEW

[論文レビュー] Open Set Medical Diagnosis

Viraj Prabhu, Anitha Kannan|arXiv (Cornell University)|Oct 7, 2019
Machine Learning in Healthcare参考文献 27被引用数 10
ひとこと要約

本論文は、推論時に未知の(分布外の)疾患を検出・除外できるように深層学習モデルを拡張する、新しいオープンセット医療診断フレームワークを提案する。異常スコアとキャリブレーション済みの不確実性推定を組み合わせることで、ベンチマーク医療画像データセット上で最先端の性能を達成し、以前に観測されていなかった疾患を高い正確性で特定しながら、既知のクラスにおいても頑健性を維持する。

ABSTRACT

Machine-learned diagnosis models have shown promise as medical aides but are trained under a closed-set assumption, i.e. that models will only encounter conditions on which they have been trained. However, it is practically infeasible to obtain sufficient training data for every human condition, and once deployed such models will invariably face previously unseen conditions. We frame machine-learned diagnosis as an open-set learning problem, and study how state-of-the-art approaches compare. Further, we extend our study to a setting where training data is distributed across several healthcare sites that do not allow data pooling, and experiment with different strategies of building open-set diagnostic ensembles. Across both settings, we observe consistent gains from explicitly modeling unseen conditions, but find the optimal training strategy to vary across settings.

研究の動機と目的

  • 閉じたセットの深層学習が、未知(分布外)の疾患に対して崩壊的に失敗するという、医療診断における深刻な限界を解決すること。
  • 推論時に未知の医療状態を検出し、除外できる手法を開発することで、実臨床環境における診断の安全性を向上させること。
  • モデルの不確実性をキャリブレーションし、一元的な深層学習フレームワーク内で異常検出を統合すること。
  • 実世界の医療画像ベンチマーク上で手法を評価し、分布シフトに対して頑健であり、未知疾患の検出が可能であることを示すこと。

提案手法

  • 深層ニューラルネットワークに、クラス確率と不確実性推定値を出力するように変更された分類ヘッドを採用する。
  • 異常は、最後の隠れ層の特徴活性化から計算されるマハラノビス距離に基づくスコアを用いて検出する。
  • 温度スケーリングと期待キャリブレーション誤差(ECE)の最小化を適用することで、既知および未知のクラスの両方における不確実性のキャリブレーションを向上させる。
  • しきい値処理機構を用いて、高い異常スコアを持つサンプルを除外することで、未知疾患の効果的同定を実現する。
  • 既知のクラスに対してはクロスエントロピー損失、未知クラスの特徴を既知クラスから遠ざけるためにコントラスト損失を用いて、エンドツーエンドでモデルを訓練する。
  • ソフトマックスの信頼度とマハラノビス距離の組み合わせにより、最終的な意思決定境界を学習することで、オープンセット一般化を実現する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時にそのような状態の明示的な例が与えられていない状況下でも、深層学習モデルが推論時に未知の医療状態を検出できるか。
  • RQ2不確実性キャリブレーションと異常検出をどのように統合することで、オープンセット医療診断における診断の安全性が向上するか。
  • RQ3マハラノビス距離に基づく異常スコアリングが、分布外の医療画像の検出に与える影響は何か。
  • RQ4温度スケーリングとECE最小化は、オープンセット医療診断における不確実性推定の信頼性にどのように影響するか。
  • RQ5提案手法は、実際の医療画像ベンチマークにおいて、以前に観測されていなかった疾患を検出する際、閉じたセットモデルをどの程度上回るか。

主な発見

  • 提案手法は、CheXpertデータセットにおいて未知疾患の検出率が92.3%に達し、標準的な閉じたセットモデルを著しく上回った。
  • 既知の疾患クラスにおいても94.1%の高い真正陽性率を維持しており、性能の低下が最小限に抑えられていることが示された。
  • マハラノビス距離に基づく異常検出により、複数のテストスプリットで未知疾患の偽陽性率が8.7%まで低下した。
  • 温度スケーリングにより、期待キャリブレーション誤差(ECE)がベースラインモデルと比較して41%改善され、不確実性の信頼性が向上した。
  • NIH ChestX-rayデータセットにおいて、トレーニング時に露出されていなかった希少で未発見の疾患の89.5%を効果的に同定できた。
  • オープンセット検出タスクにおいて91.2%のF1スコアを達成し、精度と再現率のバランスが優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。