Skip to main content
QUICK REVIEW

[논문 리뷰] Validation of a deep learning mammography model in a population with low screening rates

Kevin Wu, Eric Hsiao‐Kuang Wu|arXiv (Cornell University)|2019. 11. 01.
AI in cancer detection참고 문헌 17인용 수 5
한 줄 요약

이 연구는 미국 및 영국 데이터로 훈련된 딥러닝 유방촬영 모델을 중국의 저선별 인구에서 검증하며, 종양 크기 조정 후 AUROC 0.93과 0.90을 기록하여 강력한 일반화 능력을 입증한다. 또한 임상 적용을 위해 불확실성 기반 필터링 방법을 제안하여 모호한 케이스를 방사선과의사에게 위임함으로써 성능을 향상시킨다.

ABSTRACT

A key promise of AI applications in healthcare is in increasing access to quality medical care in under-served populations and emerging markets. However, deep learning models are often only trained on data from advantaged populations that have the infrastructure and resources required for large-scale data collection. In this paper, we aim to empirically investigate the potential impact of such biases on breast cancer detection in mammograms. We specifically explore how a deep learning algorithm trained on screening mammograms from the US and UK generalizes to mammograms collected at a hospital in China, where screening is not widely implemented. For the evaluation, we use a top-scoring model developed for the Digital Mammography DREAM Challenge. Despite the change in institution and population composition, we find that the model generalizes well, exhibiting similar performance to that achieved in the DREAM Challenge, even when controlling for tumor size. We also illustrate a simple but effective method for filtering predictions based on model variance, which can be particularly useful for deployment in new settings. While there are many components in developing a clinically effective system, these results represent a promising step towards increasing access to life-saving screening mammography in populations where screening rates are currently low.

연구 동기 및 목표

  • 미국 및 영국 데이터로 훈련된 최신 기술의 딥러닝 유방촬영 모델이 중국의 저선별 인구에 대해 일반화되는가를 평가하는 것.
  • 제한된 선별 인프라를 가진 실제 임상 환경에서 유방 밀도와 종양 크기별로 모델 성능이 어떻게 달라지는가를 평가하는 것.
  • 신규 배포 환경에서 예측의 불확실성을 식별하는 데 실용적인 측정법으로 모델 앙상블 분산을 활용할 수 있는가를 조사하는 것.
  • 높은 민감도와 특이도를 갖춘 스크리닝 워크플로우 시뮬레이션을 통해 저자원 환경에서 AI를 선별 목적에 활용할 수 있는지 탐색하는 것.

제안 방법

  • 모델은 두 단계 훈련 과정을 거쳤다: 먼저 DDSM 및 Optimam 데이터셋의 패치 수준 데이터를 MobileNet 아키텍처로 훈련한 후, 전체 유방촬영 영상에서 엔드 투 엔드로 미세조정하였다.
  • 세 개의 모델 앙상블을 사용하였으며, 수직 영상 뒤집기 및 두 시야(CC 및 MLO) 간 평균 예측을 통해 스터디 수준의 점수를 유도하였고, 이중성 기반 최대값을 사용하였다.
  • 모델 불확실성은 세 개의 모델과 두 가지 영상 방향 간의 예측 점수 분산으로 측정되었으며, 이는 고분산 케이스에 대한 필터링 기준으로 사용되었다.
  • 성능 평가는 중국 데이터셋(2,533건)에서 AUROC를 사용하였고, 종양 크기, 유방 밀도, 병변 유형별 부하 분석을 실시하였다.
  • 미국의 종양 크기 분포를 맞추기 위해 부트스트랩 재표본 추출 방법을 적용하여 DREAM 챌린지 결과와의 공정한 비교를 가능하게 하였다.

실험 결과

연구 질문

  • RQ1미국 및 영국의 고자원 인구에서 훈련된 딥러닝 유방촬영 모델이 중국의 저선별 인구에 효과적으로 일반화되는가?
  • RQ2실제 임상 환경에서 종양 크기와 유방 밀도 카테고리에 따라 모델 성능은 어떻게 달라지는가?
  • RQ3모델 앙상블 분산이 새로운 배포 환경에서 임상 선별을 안내할 수 있는 예측 불확실성의 신뢰할 수 있는 대체 측정법이 되는가?
  • RQ4고분산 예측을 필터링하면 신규 인구에서 전체 진단 성능이 얼마나 향상되는가?

주요 결과

  • 모델은 중국 데이터셋에서 유방 수준의 암 검출에 대해 AUROC 0.93 ± 0.01을 기록하였으며, 원래 DREAM 챌린지 성능과 유사하였다.
  • 부트스트랩 시뮬레이션을 통해 종양 크기를 조정한 후에도 모델은 AUROC 0.90 ± 0.03을 유지하여 인구 및 영상 차이에 대한 강력한 일반화 능력을 보였다.
  • 밀도가 높은 유방에서는 약간 낮은 성능(AUROC 0.914)을 보였고, 밀도가 낮은 유방에서는 더 높은 성능(AUROC 0.946)을 기록하였으며, 이는 DREAM 챌린지 결과와 일치하였다.
  • 높은 예측 불확실성의 케이스를 제외할수록 AUROC가 향상되었으며, 특히 불확실성 상위 40%를 필터링했을 때 가장 큰 향상이 관찰되었다.
  • 양성 병변에서 평균적으로 가장 높은 모델 분산을 보였고, 그 다음으로 정상 병변, 악성 병변 순이었으며, 이는 양성 병변이 모델이 일관되게 분류하기 어려운 경향이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.