Skip to main content
QUICK REVIEW

[논문 리뷰] Lung CT Imaging Sign Classification through Deep Learning on Small Data

Guocai He|arXiv (Cornell University)|2019. 03. 01.
COVID-19 diagnosis using AI참고 문헌 16인용 수 5
한 줄 요약

이 논문은 조건부 변동형 자동차오디오 인코더 GAN(CVAE-GAN)을 활용하여 사전 훈련을 위해 고품질의 합성 데이터를 생성하고, 실제 데이터로 미세조정하는 방식으로 소규모 데이터셋에서 폐 CT 영상 징후(CISLs)를 분류하기 위한 이단계 딥러닝 방법을 제안한다. 이 방법은 이진 분류에서 평균 정확도 95.0%를 달성하고 다중 분류에서는 91.83%를 기록하여 기존의 데이터 증강 기법과 ImageNet 전이 학습을 능가한다.

ABSTRACT

The annotated medical images are usually expensive to be collected. This paper proposes a deep learning method on small data to classify Common Imaging Signs of Lung diseases (CISL) in computed tomography (CT) images. We explore both the real data and the data generated by Generative Adversarial Network (GAN) to improve the reliability and the generalization of learning. First, we use GAN to generate a large number of CISLs from small annotated data, which are difficult to be distinguished from real counterparts. These generated samples are used to pre-train a Convolutional Neural Network (CNN) for classifying CISLs. Second, we fine-tune the CNN classification model with real data. Experiments were conducted on the LISS database of CISLs. We successfully convinced radiologists that our generated CISLs samples were real for 56.7% of our experiments. The pre-trained CNN model achieves 88.4% of mean accuracy of binary classification, and after fine-tuning, the mean accuracy is significantly increased to 95.0%. For multi-classification of all types of CISLs and normal tissues, through the two stages of training, the mean accuracy, sensitivity and specificity are up to about 91.83%, 92.73% and 99.0%, respectively. To our knowledge, this is the best result achieved on the LISS database, which demonstrates that the proposed method is effective and promising for fulfilling deep learning on small data.

연구 동기 및 목표

  • 딥러닝 모델 훈련을 위한 제한된 수의 레이블이 부여된 폐 CT 영상 문제를 해결하기 위해.
  • 소규모 데이터셋에서 폐 질환의 일반 영상 징후(CISLs)에 기반한 CNN 기반 분류의 일반화 및 신뢰성 향상을 위해.
  • ImageNet과 같은 대규모 외부 데이터셋에 의존하지 않고 과적합을 줄이고 성능을 향상시키는 방법을 개발하기 위해.
  • 전문 방사선의사들이 평가한 생성된 CISL의 품질을 검증하고, 기존의 전통적 데이터 증강 기법 및 전이 학습과의 성능를 비교하기 위해.

제안 방법

  • 실제로 존재하는 소규모 CISL 데이터에 전용으로 CVAE-GAN을 훈련시어 고품질의 합성 영상 징후를 생성한다.
  • 생성된 CISL 샘플을 사용해 컨볼루션 신경망(CNN)의 특징 학습을 향상시키기 위해 사전 훈련을 수행한다.
  • 사전 훈련된 CNN을 실제 CISL 데이터로 미세조정하여 타겟 분포에 적응하고 분류 정확도를 향상시킨다.
  • 합성 데이터로의 사전 훈련과 실제 데이터로의 미세조정을 순차적으로 수행하는 이단계 훈련 과정은 도메인 특화된 데이터 증강의 한 형태로 기능한다.
  • 이 방법은 ImageNet 사전 훈련에 의존하지 않고, 의료 영상 도메인에 특화된 GAN에 의해 생성된 데이터를 사용한다.
  • 제거 실험을 통해 기존의 전통적 데이터 증강 기법과 ImageNet에서의 전이 학습과의 성능를 비교한다.

실험 결과

연구 질문

  • RQ1전문 방사선의사들이 GAN으로 생성된 합성 폐 CT 영상 징후를 실제 영상으로 오인할 수 있는가?
  • RQ2GAN으로 생성된 CISL 데이터로 CNN을 사전 훈련하면 소규모 실제 데이터셋에서의 분류 성능이 향상되는가?
  • RQ3기존의 전통적 데이터 증강 기법과 비교해 본다면, 제안된 이단계 훈련 방법의 정확도와 일반화 능력은 어떠한가?
  • RQ4제한된 의료 영상 데이터셋에서 ImageNet에서의 전이 학습을 능가할 수 있는가?
  • RQ5소규모 데이터 환경에서 폐 CT 징후 분류에 있어 이 방법이 과적합을 얼마나 줄이는가?

주요 결과

  • 전문 방사선의사들이 GAN으로 생성된 CISL 샘플 중 56.7%를 실제 영상으로 잘못 식별하여 합성 데이터의 고품질을 확인했다.
  • 미세조정 후 이진 분류의 평균 정확도는 95.0%에 도달했으며, 이는 단순 사전 훈련만으로 달성한 88.4%보다 유의미하게 높았다.
  • 모든 CISL 유형과 정상 조직의 다중 분류에서 91.83%의 정확도, 92.73%의 민감도, 99.0%의 특이도를 기록했다.
  • 제안된 방법은 기존의 전통적 데이터 증강 기법과 ImageNet 전이 학습을 모두 능가했으며, 특히 민감도와 특이도 측면에서 뛰어났다.
  • 이단계 훈련 방식은 소규모 의료 데이터셋에서 과적합을 효과적으로 줄이고 모델의 일반화 능력을 향상시켰다.
  • 결과적으로 도메인 특화된 GAN 기반 데이터 생성은 의료 영상 분류에 있어 일반적인 데이터 증강이나 일반적인 사전 훈련보다 더 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.