Skip to main content
QUICK REVIEW

[논문 리뷰] Breast density classification with deep convolutional neural networks

Nan Wu, Krzysztof J. Geras|arXiv (Cornell University)|2017. 11. 10.
AI in cancer detection참고 문헌 11인용 수 6
한 줄 요약

이 논문은 20만 건이 넘는 걸러내기 유형의 스크리닝 유방 조영 검사 영상으로 구성된 대규모 임상적으로 현실적인 데이터셋을 사용하여 자동 유방 밀도 분류를 위한 딥 컨volution 신경망(CNN)을 제안한다. 다중 시야 유방 조영 영상으로 훈련된 모델는 인간 방사선 전문의 수준의 성능을 달성하며, 전문가 판독 결과와 높은 일치도를 보이며 주관적인 방사선학적 평가에 대한 재현 가능하고 정량적인 대안을 제공한다.

ABSTRACT

Breast density classification is an essential part of breast cancer screening. Although a lot of prior work considered this problem as a task for learning algorithms, to our knowledge, all of them used small and not clinically realistic data both for training and evaluation of their models. In this work, we explore the limits of this task with a data set coming from over 200,000 breast cancer screening exams. We use this data to train and evaluate a strong convolutional neural network classifier. In a reader study, we find that our model can perform this task comparably to a human expert.

연구 동기 및 목표

  • 기존 수작업 특징 기반 방법보다 뛰어난 성능을 보이는 엔드 투 엔드 딥 러닝 모델을 개발하는 것.
  • 20만 건이 넘는 스크리닝 유방 조영 영상으로 구성된 대규모 임상적으로 현실적인 데이터셋에서 모델의 성능을 평가하는 것.
  • 모델의 분류 정확도와 다양한 경력 수준의 방사선 전문의와의 일치도를 비교하는 것.
  • 고해상도 다중 시야 유방 조영 영상에서 딥 러닝을 활용한 자동 유방 밀도 평가의 기준을 설정하는 것.
  • 딥 러닝 모델이 임상적으로 관련성이 있는 환경에서 인간 전문가와 동등한 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • 모델는 Simonyan 등에 의해 영감을 받은 다중 컬럼 딥 컨volution 신경망 아키텍처를 사용하며, 네 가지 유방 밀도 분류에 적합하게 조정되었다.
  • 입력은 표준 유방 조영 영상의 네 시야(L-CC, R-CC, L-MLO, R-MLO)로 구성되며, 각각 해상도는 2600×2000 픽셀이다.
  • 신경망은 배치 정규화, ReLU 활성화 함수, 네 가지 밀도 카테고리에 해당하는 네 개의 유닛을 가진 소프트맥스 출력 레이어를 사용한다.
  • 비교를 위해 픽셀 강도 히스토그램(10–20개의 버킷)과 소프트맥스 회귀를 사용한 베이스라인 모델을 훈련하였으며, 100개의 유닛을 가진 은닉층이 있는지 여부에 따라 두 가지 경우를 고려했다.
  • 데이터셋은 훈련, 검증, 테스트 세트로 분할되었으며, 조기 정지 및 모델 선택을 위해 훈련 데이터의 10%가 사용되었다.
  • 성능 평가에는 매크로 평균 AUC(macAUC), 상위 1위 정확도, 상위 2위 정확도, 상위 3위 정확도, 그리고 밀도 대비 비밀도로 나누어진 슈퍼클래스 분류가 포함되었다.

실험 결과

연구 질문

  • RQ1딥 컨volution 신경망은 다중 시야 유방 조영 영상에서 인간 방사선 전문가 수준의 성능을 달성할 수 있는가?
  • RQ2대규모 임상적으로 현실적인 데이터셋에서 딥 러닝 모델의 성능는 기존 히스토그램 기반 분류기와 비교해 어떻게 되는가?
  • RQ3읽기 연구에서 딥 러닝 모델은 전문가 방사선 전문의와 지표 레이블에 대해 어느 정도의 일치도를 보이는가?
  • RQ4밀도 대비 비밀도 슈퍼클래스 분류에서 모델의 성능은 인간 전문가의 성능을 충족하거나 초월하는가?
  • RQ5고해상도 유방 조영 영상의 대규모 데이터셋에서 훈련된 딥 러닝 모델은 주관적인 방사선학적 평가에 대한 재현 가능하고 정량적인 대안을 제공할 수 있는가?

주요 결과

  • 최고의 딥 CNN 모델은 매크로 평균 AUC(macAUC) 0.934를 기록하여 인간 전문가가 기록한 0.892 macAUC를 초월했다.
  • 모델은 네 클래스 분류 작업에서 상위 1위 정확도 69.4%, 상위 2위 정확도 90.8%, 상위 3위 정확도 99.2%를 달성했다.
  • 밀도 대비 비밀도 슈퍼클래스 분류에서 모델은 82.5%의 정확도를 기록하여 인간 전문가 평균 75.8%를 뛰어넘었다.
  • Cohen’s kappa 값은 모델이 지표 레이블과의 일치도(kappa = 0.61)가 전문가 간 일치도(kappa = 0.55–0.65)와 유사함을 보였다.
  • 읽기 연구 결과, 모델의 성능가 경험 많은 방사선 전문의와 동등하며, 다양한 전문가 독자 간 일관성이 높았다.
  • 본 연구는 대규모 실세계 데이터셋에서 훈련된 딥 러닝 모델이 유방 밀도 분류에서 인간 수준의 성능을 달성할 수 있으며, 주관적인 평가에 대한 재현 가능하고 정량적인 대안을 제공할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.