Skip to main content
QUICK REVIEW

[論文レビュー] Natural vs Balanced Distribution in Deep Learning on Whole Slide Images for Cancer Detection

Ismat Ara Reshma, Sylvain Cussat‐Blanc|arXiv (Cornell University)|Dec 21, 2020
AI in cancer detection参考文献 38被引用数 4
ひとこと要約

本研究では、全身切片画像(WSI)がん検出における深層学習において、自然(アンバランス)なクラス分布と人工的にバランスされたクラス分布を比較する。10-fold交差検証を用いて、非がん領域(非ROI)ピクセルを保持する自然な分布で学習させることで、再現率を維持しつつ誤検出を低減でき、すべての指標でバランスされた分布を上回ることを示した。

ABSTRACT

The class distribution of data is one of the factors that regulates the performance of machine learning models. However, investigations on the impact of different distributions available in the literature are very few, sometimes absent for domain-specific tasks. In this paper, we analyze the impact of natural and balanced distributions of the training set in deep learning (DL) models applied on histological images, also known as whole slide images (WSIs). WSIs are considered as the gold standard for cancer diagnosis. In recent years, researchers have turned their attention to DL models to automate and accelerate the diagnosis process. In the training of such DL models, filtering out the non-regions-of-interest from the WSIs and adopting an artificial distribution (usually, a balanced distribution) is a common trend. In our analysis, we show that keeping the WSIs data in their usual distribution (which we call natural distribution) for DL training produces fewer false positives (FPs) with comparable false negatives (FNs) than the artificially-obtained balanced distribution. We conduct an empirical comparative study with 10 random folds for each distribution, comparing the resulting average performance levels in terms of five different evaluation metrics. Experimental results show the effectiveness of the natural distribution over the balanced one across all the evaluation metrics.

研究の動機と目的

  • 全身切片画像(WSI)がん検出における深層学習のパフォーマンスに、自然なクラス分布と人工的にバランスされたクラス分布が与える影響を調査すること。
  • 一般的に除外される非がん領域(非ROI)ピクセルを保持することで、モデルの一般化性能が向上し、誤検出が低減するかどうかを評価すること。
  • WSIベースの深層学習において一般的に行われるデータバランス化の実践を、自然な分布とバランスされた分布の実証的比較によって疑問視すること。
  • 非ROIデータは、しばしば破棄されるが、組織像のクラス間類似性を捉えることで、モデルの頑健性を向上させられることを示す証拠を提供すること。
  • 自然なデータ分布の使用を提唱することで、誤検出を減らし病理医の作業負荷を軽減するため、今後のWSI学習プロトコルをガイドすること。

提案手法

  • 転移性リンパ節データセットから全身切片画像(WSI)を収集・前処理し、がん(C)、非がん(¬C)、非ROI(O)領域の正解アノテーションを付与した。
  • 同じアーキテクチャを用い、学習データの分布のみが異なる2つの同一の深層学習モデル(E.a と E.b)を訓練した。E.a は自然な分布(アンバランス)を、E.b は人工的にバランスされた分布を用いた。
  • 公平な比較を確保するため、標準的なデータ増強およびトランスファー学習技術(例:ImageNet事前学習)を適用した。
  • 妥当性とパフォーマンス評価のばらつきを低減するため、10-fold交差検証を実施した。
  • 5つの指標(正解率、F1スコア、適合率、再現率、AUC)を用いてモデルを評価し、適合率-再現率トレードオフに特に注目した。
  • 誤検出の原因を特定するため、予測結果と正解マスクの可視化による失敗事例分析を実施した。特に、組織像の類似性に起因する誤検出を特定した。

実験結果

リサーチクエスチョン

  • RQ1WSI学習において、自然でアンバランスなクラス分布を使用することは、がん検出のパフォーマンスを人工的にバランスされたクラス分布よりも向上させるか?
  • RQ2非がん領域(非ROI)ピクセルは、WSI解析用の深層学習モデルにおける誤検出低減にどの程度寄与するか?
  • RQ3ROI領域と非ROI領域の間で、血球、線維化、またはリンパ球などの組織像のクラス間類似性を、訓練に代表的な非ROI例を含めることで緩和できるか?
  • RQ4WSIベースの深層学習において一般的に採用されているデータバランス化の実践は、感度を維持しつつ誤検出を最小限に抑える最適な手法と言えるか?
  • RQ5実際のWSI環境下で、自然な分布で学習したモデルとバランスされた分布で学習したモデルのパフォーマンスを、複数の評価指標で比較するとどうなるか?

主な発見

  • 自然な分布で学習したモデル(E.a)は、バランスされた分布で学習したモデル(E.b)よりも顕著に誤検出が少なく、再現率は同等を維持した。
  • 100%の再現率を達成した状態で、E.a の適合率はランダムチャンスのベースラインを著しく上回ったが、E.b の適合率はランダムに僅かに上回るにとどまり、一般化性能が低いことが示された。
  • E.a では、全foldにわたり性能指標の標準偏差が一貫して低く、自然な分布の方がより安定的かつ信頼性の高い結果を示した。
  • 可視化分析の結果、E.b の誤検出の主な原因はクラス間類似性に起因しており、特にROIと非ROI両方に血球、線維化、またはリンパ球が存在する領域が、訓練中にそのパターンが十分に表現されなかったためであった。
  • 非ROIピクセルを学習に含めることで、モデルは微細な組織像の違いを学習しやすくなり、良性に見える領域をがんと誤分類するのを減らした。
  • 本研究では、データ準備段階で非ROI領域を除外することは逆効果である可能性があり、これらの例がモデルの頑健性を高め、臨床応用における誤検出を低減することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。