Skip to main content
QUICK REVIEW

[논문 리뷰] Cluster-Based Learning from Weakly Labeled Bags in Digital Pathology

Shazia Akbar, Anne L. Martel|arXiv (Cornell University)|2018. 11. 28.
AI in cancer detection참고 문헌 7인용 수 7
한 줄 요약

이 논문은 전체 슬라이드 이미지에서 종양 전이를 탐지하기 위해 이미지 수준 레이블만을 사용하는 약한 지도 학습 방법 CCE+를 제안한다. 변동형 오토인코더를 통해 패치 특징을 군집화하고, 군집 기반의 가짜 레이블을 하이브리드 교차 엔트로피 손실에 통합함으로써, CCE+는 극도로 불균형한 클래스 분포와 노이즈가 많은 약한 레이블 조건에서도 Camelyon 데이터셋에서 완전 지도 학습과 비교할 만한 성능을 달성한다.

ABSTRACT

To alleviate the burden of gathering detailed expert annotations when training deep neural networks, we propose a weakly supervised learning approach to recognize metastases in microscopic images of breast lymph nodes. We describe an alternative training loss which clusters weakly labeled bags in latent space to inform relevance of patch-instances during training of a convolutional neural network. We evaluate our method on the Camelyon dataset which contains high-resolution digital slides of breast lymph nodes, where labels are provided at the image-level and only subsets of patches are made available during training.

연구 동기 및 목표

  • 딥 러닝 모델을 학습하기 위해 고비용의 세밀한 전문가 레이블에 대한 의존도를 줄이기 위해.
  • 전체 슬라이드 이미지 분석에서 양성(종양) 인스턴스가 5퍼센트 미만인 극도로 불균형한 클래스 분포 문제를 해결하기 위해.
  • 잠재 공간에서 패치 특징의 무 supervision 군집화를 활용하여 약한 레이블에서의 모델 학습을 향상시키기 위해.
  • 기존의 다항 교차 엔트로피와 군집-클래스 가짜 레이블을 결합한 손실 함수를 개발하기 위해.
  • 약한 지도 학습이 조직병리학 이미지 분석에서 완전 지도 학습 방법과 비슷한 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 135,000개의 패치에서 비지도 학습 방식으로 변동형 오토인코더(VAE)를 사전 학습하여 가우시안 잠재 표현을 학습한다.
  • VAE가 학습한 잠재 공간에 대해 K-평균 군집화를 적용하여 외관과 질감이 유사한 패치 인스턴스의 K개의 군집을 식별한다.
  • 해당 군집에 포함된 패치의 약한 이미지 수준 레이블을 바탕으로 다수결 투표를 통해 각 군집에 군집-클래스 레이블(C^i)을 할당한다.
  • 각 패치에 대해 가장 가까운 군집 중심이 특징 공간에서의 추정 군집-클래스 레이블(ŷ)을 결정한다.
  • 기본 다항 교차 엔트로피(CCE)와 예측값과 군집-클래스 간의 CCE를 조합한 하이브리드 손실 함수인 CCE+를 사용한다: L = α·CCE(y,p) + (1−α)·CCE(ŷ,p), 여기서 α=0.5이다.
  • InceptionNet 분류기는 이 손실 함수를 사용하여 학습되며, 배치 단위로 패치를 샘플링하여 학습 배낭 내에서 암성 및 건강한 조직의 표현이 균형을 이루도록 한다.

실험 결과

연구 질문

  • RQ1이미지 수준 레이블만을 사용하는 약한 지도 학습 접근법이 전체 슬라이드 이미지 분석에서 완전 지도 학습과 비슷한 성능을 달성할 수 있는가?
  • RQ2잠재 공간에서 패치 특징의 무 supervision 군집화를 통합함으로써 노이즈가 많은 약한 레이블 데이터에서의 학습이 어떻게 향상되는가?
  • RQ3제안된 CCE+ 손실 함수가 디지털 병리학 데이터셋에서 극도로 불균형한 클래스 분포의 악영향을 완화하는가?
  • RQ4다른(암이 아닌) 패치 비율이 높은 배낭에서 학습된 모델이 얼마나 강건한가?
  • RQ5VAE로 학습된 특징이 전문가 레이블 없이도 생물학적으로 관련 있는 조직 패턴을 얼마나 잘 포착하는가?

주요 결과

  • Camelyon 2016 데이터셋에서 CCE+는 테스트 세트에서 AUC 0.947을 기록하여 완전 지도 학습 모델과 동일한 성능을 달성했다.
  • 기본 다항 교차 엔트로피(CCE)에 비해 약한 레이블을 사용할 때 더 높은 민감도 수준에서 성능이 뛰어나 일반화 능력 향상을 시사한다.
  • α=0.5일 때 하이브리드 손실은 배낭 수준 레이블과 군집-클래스 정보 간의 균형을 잘 맞춰 최적의 성능을 내었다.
  • VAE의 잠재 공간에 대한 t-SNE 시각화에서 종양 및 건강한 패치 인스턴스 간에 명확한 분리가 관찰되어, 레이블 없이도 효과적인 특징 학습이 이루어졌음을 시사한다.
  • 100개의 군집과 α=0.5일 때, CCE+는 다양한 배낭 크기에서도 높은 정확도를 유지하여 데이터 분포 변화에 대한 강건성을 보였다.
  • 1개 WSI당 100개의 패치(총 수의 10퍼센트)만으로도 학습되었을 때 CCE+는 강력한 성능을 유지하여 저자료 환경에서의 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.