Skip to main content
QUICK REVIEW

[論文レビュー] A new semi-supervised self-training method for lung cancer prediction

Kelvin Shak, Mundher Al-Shabi|arXiv (Cornell University)|Dec 17, 2020
Lung Cancer Diagnosis and Treatment参考文献 35被引用数 4
ひとこと要約

本論文は、ノイズ付きスタディエンティスト蒸留とミックスアップ正則化を組み合わせた、肺がん予測のための新規半教師付き自己訓練フレームワークを提案する。NLSTデータセットを用いた3Dマックスアウト局所-グローバルネットワークにより、2,005枚の独立したテストスキャンでAUC 0.87を達成し、先行手法を著しく上回った(p = 0.0001)。

ABSTRACT

Background and Objective: Early detection of lung cancer is crucial as it has high mortality rate with patients commonly present with the disease at stage 3 and above. There are only relatively few methods that simultaneously detect and classify nodules from computed tomography (CT) scans. Furthermore, very few studies have used semi-supervised learning for lung cancer prediction. This study presents a complete end-to-end scheme to detect and classify lung nodules using the state-of-the-art Self-training with Noisy Student method on a comprehensive CT lung screening dataset of around 4,000 CT scans. Methods: We used three datasets, namely LUNA16, LIDC and NLST, for this study. We first utilise a three-dimensional deep convolutional neural network model to detect lung nodules in the detection stage. The classification model known as Maxout Local-Global Network uses non-local networks to detect global features including shape features, residual blocks to detect local features including nodule texture, and a Maxout layer to detect nodule variations. We trained the first Self-training with Noisy Student model to predict lung cancer on the unlabelled NLST datasets. Then, we performed Mixup regularization to enhance our scheme and provide robustness to erroneous labels. Results and Conclusions: Our new Mixup Maxout Local-Global network achieves an AUC of 0.87 on 2,005 completely independent testing scans from the NLST dataset. Our new scheme significantly outperformed the next highest performing method at the 5% significance level using DeLong's test (p = 0.0001). This study presents a new complete end-to-end scheme to predict lung cancer using Self-training with Noisy Student combined with Mixup regularization. On a completely independent dataset of 2,005 scans, we achieved state-of-the-art performance even with more images as compared to other methods.

研究の動機と目的

  • ロバストなディープラーニングモデルを訓練するための、アノテーション付き肺CTスキャンの限界を解決すること。
  • 同時に結節の検出と分類を可能にすることで、早期肺がん検出を向上させること。
  • NLSTデータセットのような大量のラベルなしCTスキャンを活用するため、半教師付き学習を活用すること。
  • ミックスアップなどの正則化技術を通じて、ラベルノイズへのモデルの汎化能力とロバスト性を向上させること。
  • 臨床現場への導入を想定した、検出・分類・自己訓練を統合したエンドツーエンドフレームワークの開発。

提案手法

  • LUNA16、LIDC、NLSTデータセットのCTスキャンにおいて、肺結節を検出するための3Dディープ畳み込みニューラルネットワークを採用する。
  • 非局所層を用いてグローバルな形状特徴を、残差ブロックを用いてローカルなテクスチャ特徴を統合するマックスアウト局所-グローバルネットワークを設計する。
  • 教師モデルが偽ラベルを生成することで、生徒モデルを訓練するノイズ付きスタディエンティストを用いた自己訓練を適用する。
  • 自己訓練中にミックスアップ正則化を導入し、誤った偽ラベルへのロバスト性を向上させる。
  • 実際のアノテーションと偽ラベルを付与されたラベルなしデータの両方を用いて、生徒モデルをエンドツーエンドで訓練し、汎化性能を向上させる。
  • マックスアウト層を用いて結節の変動パターンを捉え、がん分類のための識別能力を強化する。

実験結果

リサーチクエスチョン

  • RQ1アノテーション付きCTスキャンが限られている状況において、半教師付き自己訓練アプローチが肺がん予測性能を著しく向上させることができるか?
  • RQ2自己訓練中にラベルなしCTデータで生成される誤った偽ラベルの影響を軽減するために、ミックスアップ正則化の統合はどの程度有効か?
  • RQ3局所的テクスチャとグローバルな形状特徴を併用することで、マックスアウト局所-グローバルネットワークアーキテクチャは、標準的なモデルを上回って肺結節の検出と分類を実現できるか?
  • RQ4提案手法は、NLSTデータセットの完全に独立した2,005スキャンから成るテストセットにどの程度一般化可能か?
  • RQ5AUCとロバスト性の観点から、提案手法は既存の最先端手法を統計的に上回っているか?

主な発見

  • 提案されたミックスアップマックスアウト局所-グローバルネットワークは、NLSTデータセットの完全に独立した2,005スキャンでAUC 0.87を達成した。
  • 5%の有意水準において、次に高い性能を示したモデルを著しく上回った(DeLong検定によるp値0.0001)。
  • ミックスアップ正則化の統合により、自己訓練中に生成された誤った偽ラベルへのモデルのロバスト性が向上した。
  • ノイズ付きスタディエンティストを用いた自己訓練により、ラベルなしNLSTデータの効果的利用が可能となり、追加のアノテーションなしでモデル性能が向上した。
  • 独立したテストセットにおいて強力な汎化性能を示し、早期肺がん検出における臨床的潜在能力を確認した。
  • マックスアウト局所-グローバルネットワークは、局所的結節テクスチャとグローバルな形状特徴を効果的に捉えており、分類精度の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。