Skip to main content
QUICK REVIEW

[論文レビュー] Robust Learning at Noisy Labeled Medical Images: Applied to Skin Lesion Classification

Cheng Xue, Qi Dou|arXiv (Cornell University)|Jan 23, 2019
Machine Learning and Data Classification参考文献 13被引用数 6
ひとこと要約

本稿では、ノイズの多い医療画像ラベル下での頑健な皮膚腫瘍分類のための反復的ディープラーニングフレームワークを提案する。オンライン不確実性サンプルマイニングを用いてノイズの多いサンプルを抑制し、ハードサンプルおよびレアクラスサンプルを保持するためのサンプル再重み付け戦略を採用する。本手法は、ノイズ分布の事前知識やクリーンな検証データを必要とせず、ノイズのある皮膚腫瘍データセットで最先端の性能を達成する。

ABSTRACT

Deep neural networks (DNNs) have achieved great success in a wide variety of medical image analysis tasks. However, these achievements indispensably rely on the accurately-annotated datasets. If with the noisy-labeled images, the training procedure will immediately encounter difficulties, leading to a suboptimal classifier. This problem is even more crucial in the medical field, given that the annotation quality requires great expertise. In this paper, we propose an effective iterative learning framework for noisy-labeled medical image classification, to combat the lacking of high quality annotated medical data. Specifically, an online uncertainty sample mining method is proposed to eliminate the disturbance from noisy-labeled images. Next, we design a sample re-weighting strategy to preserve the usefulness of correctly-labeled hard samples. Our proposed method is validated on skin lesion classification task, and achieved very promising results.

研究の動機と目的

  • 専門知識が求められる高難易度の分野における医療画像データセットにおけるラベルノイズの深刻な課題に対処すること。
  • トレーニングデータに誤分類された画像が含まれる状況下でも、皮膚腫瘍分類におけるディープニューラルネットワークの性能を向上させること。
  • 事前推定されたノイズ遷移行列や追加のクリーンラベルデータに依存しない手法を開発すること。
  • ノイズラベル環境下でもハードサンプルおよびマイノリティクラスサンプルの有用性を維持すること。

提案手法

  • オンライン不確実性サンプルマイニング(OUSM)戦略により、各トレーニングイテレーションで低損失(低不確実性)のサンプルを選択し、バックプロパゲーションに使用する。これにより、高不確実性(おそらくノイズ)のサンプルが効果的にフィルタリングされる。
  • サンプル再重み付けモジュールは、深層特徴に基づいて個々のサンプルに重みを割り当て、ハード例およびマイノリティクラスサンプルを強調することで、トレーニング中にそれらが埋もれることを防ぐ。
  • フレームワークは反復的に訓練され、最初の5エポックは再重み付けなしで行い、初期学習を安定化させる。その後の段階でOUSMと再重み付けを併用する。
  • 損失関数は再重み付けされたソフトマックス損失とオンライン不確実性損失を組み合わせており、勾配計算は低不確実性サンプルにのみ適用される。
  • 本手法はエンドツーエンドで学習可能であり、ノイズ遷移行列の明示的推定や外部のクリーンデータを必要としない。
  • 本手法はResNet-101に適用され、SGD最適化を用い、適応的重み付け付き交差エントロピー損失とバッチ正則化を用いる。

実験結果

リサーチクエスチョン

  • RQ1ノイズ分布の事前仮定なしに、オンライン不確実性サンプルマイニングが皮膚腫瘍分類におけるノイズラベルの影響を効果的に抑制できるか?
  • RQ2ハードサンプルおよびマイノリティクラスサンプルが存在するノイズのある医療データセットにおいて、個々のサンプル再重み付けがモデルの一般化性能をどのように向上させるか?
  • RQ3不確実性マイニングと再重み付けを組み合わせることで、従来手法に比べてどの程度性能が向上するか?
  • RQ4追加のクリーンラベルデータや事前推定されたノイズ遷移行列を必要としない本手法が、頑健な性能を達成できるか?

主な発見

  • 5%のノイズラベルベンチマークにおいて、本手法は84.5%の精度を達成し、最先端手法[4]を1.3ポイント上回った。
  • 10%のノイズ下でも83.6%の精度を達成し、[4]を2.3ポイント上回り、ノイズ増加に対しても強い頑健性を示した。
  • アブレーションスタディの結果、オンライン不確実性マイニングと個別再重み付けの両方が性能向上に寄与していることが確認され、特にハードサンプルおよびマイノリティクラスサンプルに対して再重み付けが極めて重要であることが示された。
  • ノイズのあるデータに対して交差エントロピー損失のみで学習したモデルは、10%のノイズ下で79.1%の精度に低下し、本手法のコンponentsの必要性を浮き彫りにした。
  • 40%のノイズ下でも本手法は75.7%のテスト精度を達成し、[4](68.4%)を著しく上回り、高ノイズレベルに対しても強い耐性を示した。
  • 結果から、DNNがノイズラベルを記憶してしまうことが確認されたが、本フレームワークにより高不確実性サンプルをフィルタリングし、有用なサンプルを保持することで、この問題を効果的に緩和できることを検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。