Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot and Few-Shot Learning for Lung Cancer Multi-Label Classification using Vision Transformer

Fu-Ming Guo, Yingfang Fan|arXiv (Cornell University)|2022. 05. 30.
AI in cancer detection인용 수 4
한 줄 요약

이 연구는 LC25000 데이터셋을 사용하여 조직병리학 슬라이드에서 폐암 아형(LUAD, LUSC, 양성)에 대한 제로샷 및 희소샷 다중 레이블 분류를 위한 비전 트랜스포머(ViT) 기반 접근법을 제안한다. 미리 훈련된 ViT는 5개의 미세조정 에포크 후 희소샷 학습에서 99.87%의 정확도를 기록하고, 검증 및 테스트 세트에서 모두 100%의 정확도를 달성하여 극히 적은 레이블 데이터로도 강력한 일반화 능력을 보여준다.

ABSTRACT

Lung cancer is the leading cause of cancer-related death worldwide. Lung adenocarcinoma (LUAD) and lung squamous cell carcinoma (LUSC) are the most common histologic subtypes of non-small-cell lung cancer (NSCLC). Histology is an essential tool for lung cancer diagnosis. Pathologists make classifications according to the dominant subtypes. Although morphology remains the standard for diagnosis, significant tool needs to be developed to elucidate the diagnosis. In our study, we utilize the pre-trained Vision Transformer (ViT) model to classify multiple label lung cancer on histologic slices (from dataset LC25000), in both Zero-Shot and Few-Shot settings. Then we compare the performance of Zero-Shot and Few-Shot ViT on accuracy, precision, recall, sensitivity and specificity. Our study show that the pre-trained ViT model has a good performance in Zero-Shot setting, a competitive accuracy ($99.87\%$) in Few-Shot setting ({epoch = 1}) and an optimal result ($100.00\%$ on both validation set and test set) in Few-Shot seeting ({epoch = 5}).

연구 동기 및 목표

  • 희소한 레이블이 부여된 조직병리학 데이터로 인한 폐암 진단의 과제를 해결하기 위해, 제로샷 및 희소샷 학습을 위한 사전 훈련된 비전 트랜스포머를 활용한다.
  • 최소한의 또는 전혀 미세조정 없이도 전체 슬라이드 이미지에서 다수의 폐암 아형(LUAD, LUSC, 양성)을 분류하는 비전 트랜스포머의 성능을 평가한다.
  • LC25000 데이터셋을 사용하여 ViT를 활용한 제로샷 및 희소샷 전이 학습 전략을 다중 레이블 분류에 대해 비교한다.
  • Grad-CAM을 활용해 모델 예측을 해석하고 전문 병리의사의 시각적 추론과의 일치성을 검증한다.

제안 방법

  • 희소샷 학습을 위해 LC25000 데이터셋에서 사전 훈련된 비전 트랜스포머(ViT) 모델을 5 에포크 동안 미세조정하고, 각 에포크마다 검증을 수행한다.
  • 사전 훈련된 ViT 모델의 동결된 가중치를 그대로 사용하여, 하류 분류 작업에 대한 미세조정 없이 제로샷 추론을 적용한다.
  • 기울기 가중치 클래스 활성화 맵(Grad-CAM)을 활용해 조직병리학 이미지의 분류에 기여하는 영역을 강조하는 열지도를 생성하여 모델의 해석 가능성 확보.
  • Grad-CAM 시각화 결과를 전문 병리의사의 주석과 비교하여 모델의 신뢰성과 임상적 추론과의 일치성을 평가한다.
  • 모든 세 클래스(LUAD, LUSC, 양성)에 대해 정확도, 정밀도, 재현율, 민감도, 특이도 및 AUC-ROC를 사용해 모델 성능을 평가한다.
  • 자기지도 학습 및 전이 학습을 활용해 자연 이미지와 의료 조직병리학 이미지 간의 도메인 차이를 완화한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 비전 트랜스포머는 조직병리학 슬라이드에서 폐암 아형을 제로샷 분류할 때 얼마나 잘 성능을 내는가?
  • RQ2희소샷 미세조정이 비전 트랜스포머 모델의 다중 레이블 폐암 분류 성능에 얼마나 기여하는가? 이 성능은 훈련 에포크에 따라 어떻게 변화하는가?
  • RQ3ViT 모델의 Grad-CAM 시각화 결과는 병리의사가 암성 영역을 식별하는 데 사용하는 임상적 의사결정 과정과 얼마나 일치하는가?
  • RQ4제로샷 및 희소샷 설정에서 ViT 모델의 AUC-ROC 성능은 LUAD, LUSC 및 양성 클래스 간에 어떻게 비교되는가?
  • RQ5ViT 모델은 적대적 편향과 데이터셋 편향에 대해 강건성과 해석 가능성을 유지하는가?

주요 결과

  • 제로샷 설정에서 사전 훈련된 비전 트랜스포머는 검증 정확도 33.77%와 테스트 정확도 33.77%를 기록하여, 미세조정 없이선 일반화 능력이 제한됨을 시사한다.
  • 한 에포크의 미세조정 후, 희소샷 설정에서 ViT 모델은 검증 세트에서 98.90%의 정확도, 테스트 세트에서 98.87%의 정확도를 달성한다.
  • 다섯 에포크의 미세조정 후, ViT 모델은 검증 및 테스트 세트에서 모두 100.00%의 정확도를 기록하여 극히 적은 데이터로 최적의 성능을 달성함을 나타낸다.
  • 희소샷 설정에서 ViT 모델의 AUC-ROC 값(에포크=5)은 세 클래스(LUAD, LUSC, 양성) 모두에서 1.00000000으로 나타나 완벽한 분류 능력을 보임을 의미한다.
  • Grad-CAM 시각화 결과는 병리의사가 전문적으로 식별한 주요 영역과 강한 공간 일치성을 보이며, 모델의 해석 가능성과 임상적 관련성을 검증한다.
  • 모델은 적대적 편향에 대해 강건성을 보이며, 데이터셋 편향을 드러내어 신뢰할 수 있는 주의 분포를 통해 일반화 능력을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.