Skip to main content
QUICK REVIEW

[論文レビュー] Deep Expectation-Maximization for Semi-Supervised Lung Cancer Screening

Sumeet Menon, David Chapman|arXiv (Cornell University)|Oct 2, 2020
COVID-19 diagnosis using AI参考文献 16被引用数 9
ひとこと要約

本論文は、期待値最大化(EM)アルゴリズムを用いた半教師付き深層学習フレームワークを提案し、ラベルありおよびラベルなしCTスキャンデータを活用して肺がんスクリーニング用の3次元畳み込みニューラルネットワーク(CNN)を訓練する。ラベルなしラベルを潜在変数として扱うことで、より小さなデータセットからのラベル付きデータのみを用いた完全教師ありベースラインを上回る分類精度を達成し、NLSTデータ上で最大81.1%の精度を達成し、教師ありベースライン比で20%の向上を実現した。

ABSTRACT

We present a semi-supervised algorithm for lung cancer screening in which a 3D Convolutional Neural Network (CNN) is trained using the Expectation-Maximization (EM) meta-algorithm. Semi-supervised learning allows a smaller labelled data-set to be combined with an unlabeled data-set in order to provide a larger and more diverse training sample. EM allows the algorithm to simultaneously calculate a maximum likelihood estimate of the CNN training coefficients along with the labels for the unlabeled training set which are defined as a latent variable space. We evaluate the model performance of the Semi-Supervised EM algorithm for CNNs through cross-domain training of the Kaggle Data Science Bowl 2017 (Kaggle17) data-set with the National Lung Screening Trial (NLST) data-set. Our results show that the Semi-Supervised EM algorithm greatly improves the classification accuracy of the cross-domain lung cancer screening, although results are lower than a fully supervised approach with the advantage of additional labelled data from the unsupervised sample. As such, we demonstrate that Semi-Supervised EM is a valuable technique to improve the accuracy of lung cancer screening models using 3D CNNs.

研究の動機と目的

  • 肺がんスクリーニングにおけるラベル付き医療画像データの不足に取り組む。
  • ドメイン間の肺がん分類における3次元CNNの汎化性能と精度を向上させる。
  • EMアルゴリズムを用いて、ラベルなしデータの潜在ラベルを推定するとともに、CNN重みを同時に最適化する可能性を検討する。
  • 半教師付き学習におけるEMの有効性を評価し、大規模なラベルなしCTスキャンを活用してモデル性能を向上させられるかを検証する。
  • 半教師付きEMの性能を、完全教師ありベースラインおよび完全ラベル付き学習の上限性能と比較する。

提案手法

  • 本手法は、ラベルあり(観測済み)およびラベルなし(潜在的)ラベルを併用する状況下で、3次元CNNを訓練するための期待値最大化(EM)メタアルゴリズムを採用する。
  • Eステップでは、現在のCNN重みを用いて、ラベルなしCTスキャンのクラス確率を予測する。
  • Mステップでは、Eステップで得られた疑似ラベル予測とラベル付きデータを併用して、尤度を最大化するようにCNNを再訓練する。
  • 本フレームワークは、異なるデータ量と画像プロトコルを持つ2つの異なる肺がんスクリーニングデータセット、Kaggle Data Science Bowl 2017(Kaggle17)およびNational Lung Screening Trial(NLST)を統合して使用する。
  • モデルは2層の3次元CNNおよびAlexNetアーキテクチャを用い、データは50×50×50ボクセルの20スライスのチャンクに事前処理される。
  • ドメイン間評価は、1つのデータセットのラベル付きデータで学習し、もう一方のデータセットのラベルなしデータを統合することで実施し、現実のデータ不足状況を模擬する。

実験結果

リサーチクエスチョン

  • RQ1EMアルゴリズムは、ラベルなしCTスキャンを用いた半教師付き学習に応用した場合、肺がんスクリーニングにおける3次元CNN性能を効果的に向上させることができるか?
  • RQ2ラベル付きデータのみで学習した完全教師ありモデルと比較して、半教師付きEMベースのモデルの性能はどの程度向上するか?
  • RQ3より大きなドメイン外データセット(NLST)からのラベルなしデータを統合することで、より小さなドメイン内データセット(Kaggle17)における分類精度はどの程度向上するか?
  • RQ4ラベル付きデータに対するラベルなしデータのサイズ比が大きくなるに従い、半教師付きEMによる性能向上はスケーリングするか?
  • RQ5ラベル付きデータがより小さなデータセットから、ラベルなしデータがより大きなデータセットから供給される場合、EMベースのアプローチはより効果的か?

主な発見

  • Kaggle17のラベル付きデータで学習し、NLSTのラベルなしデータを統合した場合、2層3次元CNNの精度は75.95%から77.5%に上昇し、1.55%の絶対的向上を達成した。
  • AlexNetアーキテクチャでは、同じクロスドメイン設定下で79.36%から81.1%に上昇し、1.74%の向上を示した。
  • NLSTのラベル付きデータで学習し、Kaggle17でテストした場合、2層3次元CNNは76.75%から78.1%に、1.35%向上した。一方、AlexNetは72.9%から74.4%に上昇した。
  • 半教師付きEMによる向上幅は、両データセットの全ラベル付きデータを用いた完全教師あり上限性能が達成する性能向上幅の約半分に留まった。
  • ラベル付きデータがより小さなKaggle17データセットから、ラベルなしデータがより大きなNLSTデータセットから供給される場合、相対的な向上幅がより大きくなり、特にラベル付きデータが少ない環境下でのデータ効率性が優れていることが示された。
  • 結果は、ラベル付きデータが限られるが大規模なラベルなしスキャンが利用可能な状況において、EMベースの半教師付き学習が3次元CNNの医療画像分野への応用において有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。