Skip to main content
QUICK REVIEW

[논문 리뷰] A new semi-supervised self-training method for lung cancer prediction

Kelvin Shak, Mundher Al-Shabi|arXiv (Cornell University)|2020. 12. 17.
Lung Cancer Diagnosis and Treatment참고 문헌 35인용 수 4
한 줄 요약

이 논문은 Noisy Student distillation과 Mixup 정규화를 결합한 새로운 준지도 학습 자기학습 프레임워크를 제안하여 CT 영상에서 폐암 예측 성능을 향상시킨다. NLST 데이터셋에 3D Maxout 로컬-글로벌 네트워크를 적용하여 독립적인 테스트 스캔 2,005장에서 AUC 0.87을 달성하였으며, 이는 이전 방법들보다 유의미하게 뛰어나다 (p = 0.0001).

ABSTRACT

Background and Objective: Early detection of lung cancer is crucial as it has high mortality rate with patients commonly present with the disease at stage 3 and above. There are only relatively few methods that simultaneously detect and classify nodules from computed tomography (CT) scans. Furthermore, very few studies have used semi-supervised learning for lung cancer prediction. This study presents a complete end-to-end scheme to detect and classify lung nodules using the state-of-the-art Self-training with Noisy Student method on a comprehensive CT lung screening dataset of around 4,000 CT scans. Methods: We used three datasets, namely LUNA16, LIDC and NLST, for this study. We first utilise a three-dimensional deep convolutional neural network model to detect lung nodules in the detection stage. The classification model known as Maxout Local-Global Network uses non-local networks to detect global features including shape features, residual blocks to detect local features including nodule texture, and a Maxout layer to detect nodule variations. We trained the first Self-training with Noisy Student model to predict lung cancer on the unlabelled NLST datasets. Then, we performed Mixup regularization to enhance our scheme and provide robustness to erroneous labels. Results and Conclusions: Our new Mixup Maxout Local-Global network achieves an AUC of 0.87 on 2,005 completely independent testing scans from the NLST dataset. Our new scheme significantly outperformed the next highest performing method at the 5% significance level using DeLong's test (p = 0.0001). This study presents a new complete end-to-end scheme to predict lung cancer using Self-training with Noisy Student combined with Mixup regularization. On a completely independent dataset of 2,005 scans, we achieved state-of-the-art performance even with more images as compared to other methods.

연구 동기 및 목표

  • 강력한 딥 러닝 모델을 훈련하기 위해 부족한 레이블이 부여된 폐 CT 영상 데이터의 문제를 해결한다.
  • 동시에 결절 탐지와 분류를 가능하게 하여 조기 폐암 검출을 향상시킨다.
  • 대규모의 레이블이 없는 CT 영상, 예를 들어 NLST 데이터셋과 같은 자료를 활용하기 위해 준지도 학습을 활용한다.
  • Mixup와 같은 정규화 기법을 통해 레이블 노이즈에 대한 모델의 일반화 능력과 강건성을 향상시킨다.
  • 임상적 적용을 위해 탐지, 분류 및 자기학습을 통합한 엔드 투 엔드 프레임워크를 개발한다.

제안 방법

  • LUNA16, LIDC, NLST 데이터셋에서 폐 결절을 탐지하기 위해 3D 딥 컨볼루션 신경망을 활용한다.
  • 비국소층을 통해 글로벌 형태 특징을, 잔차 블록을 통해 로컬 텍스처 특징을 결합한 Maxout 로컬-글로벌 네트워크를 설계한다.
  • 선생 모델이 가짜 레이블을 생성하여 학생 모델을 훈련시키는 Noisy Student를 활용한 자기학습을 적용한다.
  • 자기학습 과정에서 잘못된 가짜 레이블에 대한 강건성을 향상시키기 위해 훈련 중 Mixup 정규화를 도입한다.
  • 실제 레이블과 가짜 레이블이 부여된 비라벨 데이터를 모두 사용하여 학생 모델을 엔드 투 엔드로 훈련시켜 일반화 능력을 향상시킨다.
  • Maxout 레이어를 사용하여 결절의 변형 패턴을 포착함으로써 악성 종양 분류에 대한 분류 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 레이블이 부여된 CT 영상만 존재할 경우, 준지도 자기학습 접근 방식이 폐암 예측 성능을 크게 향상시킬 수 있는가?
  • RQ2자기학습 과정에서 비라벨 CT 데이터를 대상으로 가짜 레이블의 노이즈 영향을 줄이기 위해 Mixup 정규화를 통합하는 것이 얼마나 효과적인가?
  • RQ3로컬 텍스처와 글로벌 형태 특징을 모두 활용할 경우, Maxout 로컬-글로벌 네트워크 아키텍처가 표준 모델보다 폐 결절 탐지 및 분류 성능에서 뛰어나게 되는가?
  • RQ4제안된 방법이 NLST 데이터셋의 완전히 독립적인 테스트 세트 2,005장에 대해 어느 정도 일반화되는가?
  • RQ5AUC와 강건성 측면에서 제안된 방법이 기존 최신 기술적 접근 방식보다 통계적으로 뛰어나게 되는가?

주요 결과

  • 제안된 Mixup Maxout 로컬-글로벌 네트워크는 NLST 데이터셋의 완전히 독립적인 테스트 스캔 2,005장에서 AUC 0.87을 달성하였다.
  • 5% 유의수준에서 다음으로 높은 성능을 보인 모델보다 유의미하게 뛰어나며, DeLong 검정을 통해 p-값 0.0001을 기록하였다.
  • Mixup 정규화 통합으로 인해 자기학습 과정에서 생성된 오류가 있는 가짜 레이블에 대한 모델의 강건성이 향상되었다.
  • Noisy Student를 활용한 자기학습을 통해 레이블이 없는 NLST 데이터를 효과적으로 활용할 수 있었으며, 추가적인 레이블링 없이도 모델 성능 향상에 기여하였다.
  • 독립적인 테스트 세트에서 강력한 일반화 능력을 보이며, 조기 폐암 검출을 위한 임상적 잠재력을 확인하였다.
  • Maxout 로컬-글로벌 네트워크는 로컬 결절 텍스처와 글로벌 형태 특징을 효과적으로 포착하여 분류 정확도 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.