Skip to main content
QUICK REVIEW

[논문 리뷰] A Closer Look at Domain Shift for Deep Learning in Histopathology

Karin Stacke, Gabriel Eilertsen|arXiv (Cornell University)|2019. 09. 25.
AI in cancer detection참고 문헌 23인용 수 47
한 줄 요약

이 논문은 스캐너 간 CNN 종양 분류기의 도메인 시프트를 조직 병리학에서 연구하고, 표현 시프트 지표를 제안하며 CAMELYON17 데이터에 대한 증강/정규화 기법을 평가한다.

ABSTRACT

Domain shift is a significant problem in histopathology. There can be large differences in data characteristics of whole-slide images between medical centers and scanners, making generalization of deep learning to unseen data difficult. To gain a better understanding of the problem, we present a study on convolutional neural networks trained for tumor classification of H&E stained whole-slide images. We analyze how augmentation and normalization strategies affect performance and learned representations, and what features a trained model respond to. Most centrally, we present a novel measure for evaluating the distance between domains in the context of the learned representation of a particular model. This measure can reveal how sensitive a model is to domain variations, and can be used to detect new data that a model will have problems generalizing to. The results show how learning is heavily influenced by the preparation of training data, and that the latent representation used to do classification is sensitive to changes in data distribution, especially when training without augmentation or normalization.

연구 동기 및 목표

  • 다양한 스캐너 간 H&E 전 슬라이드 이미지에서 도메인 시프트가 CNN 기반 종양 분류에 어떤 영향을 미치는지 이해한다.
  • 증강 및 정규화 전략이 성능과 학습된 표현에 어떤 영향을 미치는지 평가한다.
  • 도메인 유발 특징 표현의 변화를 정량화하는 표현 시프트 지표를 도입한다.

제안 방법

  • CAMELYON17 H&E WSI 패치를 세 스캐너에서 사용해 도메인 간 이동을 시뮬레이션한다.
  • 증강/정규화 여부에 따라 두 개의 작은 CNN 아키텍처(Simple CNN 및 Mini-GoogLeNet)을 평가한다.
  • 컬러 증강, 염색 정규화, CycleGAN 기반 도메인 번역을 테스트 데이터에 적용한다.
  • 모델이 의존하는 특징을 해석하기 위해 학습된 필터를 시각화한다.
  • 마지막 합성층의 각 필터 활성화 간 Wasserstein 거리를 기반으로 하는 표현 시프트 지표를 제안하고 계산한다.

실험 결과

연구 질문

  • RQ1한 스캐너에서 학습하고 보지 않은 다른 스캐너에서 테스트할 때 교차 데이터셋 일반화가 얼마나 잘 수행되는가?
  • RQ2다양한 데이터 처리 전략에서 CNN이 학습하는 특징은 무엇이며, 이것이 도메인 시프트에 대한 강건성에 어떤 영향을 미치는가?
  • RQ3표현 시프트 지표가 교차 도메인 분류 정확도 하락을 예측할 수 있는가?

주요 결과

  • 증강 없이 교차 스캐너 일반화가 크게 하락한다(평균 손실 약 21.7 포인트).
  • 컬러 증강은 교차 스캐너 일반화를 더 작게 감소시키며 일반화 하락을 약 4.75 포인트로 줄인다.
  • 염색 정규화는 일부 보지 못한 사례에 도움이 되지만 특정 스캐너에서 더 큰 하락(약 9.2 포인트)을 초래할 수 있다.
  • CycleGAN은 동일 스캐너 내 성능은 최상이나 스캐너 간 일반화에는 더 잘 작동하지 않으며 최대 약 11.45 포인트 하락.
  • 피처 시각화는 데이터 처리에 따라 학습된 표현이 달라짐을 보여주며, 컬러 증강은 모델이 색상을 더 완전히 무시하도록 만드는 경향이 있다.
  • 표현 시프트와 패치 수준 정확도 간에 음의 상관관계가 존재하며, 더 큰 시프트일수록 도메인 간 정확도가 낮아지는 경향이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.