Skip to main content
QUICK REVIEW

[論文レビュー] Improving Medical Image Classification with Label Noise Using Dual-uncertainty Estimation

Lie Ju, Xin Wang|arXiv (Cornell University)|Feb 28, 2021
Machine Learning and Data Classification参考文献 48被引用数 11
ひとこと要約

本稿では、専門家間のばらつきに起因する不一致ノイズ(expert variability 由来)と誤診に起因する単一ターゲットノイズ(incorrect diagnoses 由来)を区別することで、ラベルノイズ下での医療画像分類を向上させる二重不確実性推定フレームワークを提案する。Improved Direct Uncertainty Prediction および Monte Carlo Dropout を用いて不確実性を推定し、正規化された不確実性スコアによりサンプルを再重み付けし、ブースティングに基づくカリキュラム学習手順を適用することで、新たに公開された複数の眼科医によるアノテーションを含むベンチマークデータセットを用いて、皮膚、前立腺、網膜疾患データセットで最先端の性能を達成した。

ABSTRACT

Deep neural networks are known to be data-driven and label noise can have a marked impact on model performance. Recent studies have shown great robustness to classic image recognition even under a high noisy rate. In medical applications, learning from datasets with label noise is more challenging since medical imaging datasets tend to have asymmetric (class-dependent) noise and suffer from high observer variability. In this paper, we systematically discuss and define the two common types of label noise in medical images - disagreement label noise from inconsistency expert opinions and single-target label noise from wrong diagnosis record. We then propose an uncertainty estimation-based framework to handle these two label noise amid the medical image classification task. We design a dual-uncertainty estimation approach to measure the disagreement label noise and single-target label noise via Direct Uncertainty Prediction and Monte-Carlo-Dropout. A boosting-based curriculum training procedure is later introduced for robust learning. We demonstrate the effectiveness of our method by conducting extensive experiments on three different diseases: skin lesions, prostate cancer, and retinal diseases. We also release a large re-engineered database that consists of annotations from more than ten ophthalmologists with an unbiased golden standard dataset for evaluation and benchmarking.

研究の動機と目的

  • 医療画像分野における二つの代表的なラベルノイズ、すなわち専門家のばらつきに起因する不一致ノイズと誤診に起因する単一ターゲットノイズを体系的に定義し、それらに対処する。
  • アノテーションの不一致と予測の信頼性の両方からの不確実性を測定することで、ノイズの含まれるサンプルを検出する二重不確実性推定フレームワークを開発する。
  • 不確実性スコアに基づくサンプル再重み付けにより、極めて不均衡な医療データセットにおけるモデルの耐性を向上させ、マイノリティクラスや困難なサンプルの影響を保持する。
  • クリティカルなサンプルと再重み付けされたノイズを段階的に学習するデータ駆動型のブースティング風カリキュラム学習手順を導入する。
  • 今後の研究のための高品質なベンチマークデータセットを公開する。本データセットは17種の網膜疾患を10名以上の眼科医がアノテートした、大規模かつ高品質なデータセットである。

提案手法

  • Improved Direct Uncertainty Prediction (iDUP) を用いて、複数の専門家によるアノテーションからの不確実性を推定し、不一致ノイズを捉える。
  • Monte Carlo Dropout (MC-Dropout) を用いて、多数決によるラベルが与えられたサンプルの予測不確実性を推定し、単一ターゲットラベルノイズを検出する。
  • 正規化された不確実性スコアを計算し、困難なサンプルおよびマイノリティクラスサンプルの影響を保持するようにトレーニングサンプルを再重み付けする。
  • クリティカルなサンプルから始まり、再重み付けされたノイズを含むサンプルへ段階的に学習するデータ駆動型のブースティングベースのカリキュラム学習手順を設計する。
  • クラスの不均衡下での学習安定性と性能向上を図るため、Focal Loss と Weighted Cross-Entropy を統合する。
  • 本手法は、3つの医療画像分類タスク(ISIC 2019(皮膚病変)、Gleason 2019(前立腺がん)、Kaggle DR+(網膜疾患))で評価された。

実験結果

リサーチクエスチョン

  • RQ1複数の専門家によるアノテーションからの不一致ノイズは、医療画像分類において、どのように効果的にモデル化され、クリーンなラベルと区別されるか?
  • RQ2MC-Dropout を用いた予測不確実性推定は、医療画像データセットにおける単一ターゲットラベルノイズをどの程度効果的に検出できるか?
  • RQ3不確実性スコアに基づくサンプル再重み付けは、困難なサンプルやマイノリティクラスサンプルを破棄せずに、不均衡な医療データセットにおけるモデル性能を向上させることができるか?
  • RQ4提案されたブースティング風カリキュラム学習手順は、ラベルノイズ下での標準的な学習と比較して、モデルの耐性をどのように向上させるか?
  • RQ5二重不確実性推定フレームワークは、現実のラベルノイズを含むベンチマーク医療画像分類タスクにどのような影響を与えるか?

主な発見

  • Kaggle DR+ データセットにおいて、本手法は多数決ラベルを用いたベースライン(F1: 51.05)および元のラベル(F1: 45.42)を大幅に上回る F1 スコア 55.91 を達成した。
  • ISIC 2019 データセットでは、F1 スコア 81.01 を達成し、最良のベースライン(F1: 80.09)を上回り、ラベルノイズ下でも耐性があることを示した。
  • アブレーションスタディの結果、Focal Loss と二重不確実性推定を組み合わせた場合、わずかな向上が得られたが、完全なフレームワークは個々のコンponentsを上回る性能を示した。
  • Gleason 2019 データセットにおいて、iUOD モジュールは η=1 時に最適な性能を示し、医師数の分散が大きい場合の不整合アノテーションの処理が改善されたことを示した。
  • 不確実性に基づく外れ値検出(UoSL)は、誤検出の例(UoSL = 0.73)を正しく特定し、誤ラベル画像に対する感受性を示した。
  • 視覚的差が小さい近縁クラス(例:NPDRI vs. NPDRII)の区別には限界が見られ、UoSL スコアが中程度(0.51)にとどまり、微細な誤ラベルの検出感度が低下していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。