Skip to main content
QUICK REVIEW

[논문 리뷰] SCREENet: A Multi-view Deep Convolutional Neural Network for Classification of High-resolution Synthetic Mammographic Screening Scans

Saeed Seyyedi, Margaret J. Wong|arXiv (Cornell University)|2020. 09. 18.
AI in cancer detection참고 문헌 26인용 수 8
한 줄 요약

SCREENet는 해상도가 높은 디지털 유방 단층촬영(DBT)에서 유도된 합성 유방 조영 사진을 내림리샘플링 없이 BI-RADS 분류 체계로 분류하는 다중 시야 딥 컨volution 네트워크(MV-CNN)이다. BI-RADS 0(정상)과 비-BI-RADS 0(이상 또는 추가 검사 필요)를 구분하는 데 AUC 0.912를 기록했으며, 더 작은 데이터셋이나 낮은 해상도 이미지로 훈련할 경우 성능이著しく 떨어졌다.

ABSTRACT

Purpose: To develop and evaluate the accuracy of a multi-view deep learning approach to the analysis of high-resolution synthetic mammograms from digital breast tomosynthesis screening cases, and to assess the effect on accuracy of image resolution and training set size. Materials and Methods: In a retrospective study, 21,264 screening digital breast tomosynthesis (DBT) exams obtained at our institution were collected along with associated radiology reports. The 2D synthetic mammographic images from these exams, with varying resolutions and data set sizes, were used to train a multi-view deep convolutional neural network (MV-CNN) to classify screening images into BI-RADS classes (BI-RADS 0, 1 and 2) before evaluation on a held-out set of exams. Results: Area under the receiver operating characteristic curve (AUC) for BI-RADS 0 vs non-BI-RADS 0 class was 0.912 for the MV-CNN trained on the full dataset. The model obtained accuracy of 84.8%, recall of 95.9% and precision of 95.0%. This AUC value decreased when the same model was trained with 50% and 25% of images (AUC = 0.877, P=0.010 and 0.834, P=0.009 respectively). Also, the performance dropped when the same model was trained using images that were under-sampled by 1/2 and 1/4 (AUC = 0.870, P=0.011 and 0.813, P=0.009 respectively). Conclusion: This deep learning model classified high-resolution synthetic mammography scans into normal vs needing further workup using tens of thousands of high-resolution images. Smaller training data sets and lower resolution images both caused significant decrease in performance.

연구 동기 및 목표

  • 디지털 유방 단층촬영(DBT)에서 유도된 고해상도 합성 유방 조영 사진을 BI-RADS 분류 체계로 분류하는 딥 러닝 모델을 개발한다.
  • 이미지 해상도와 훈련 데이터셋 크기가 모델 성능에 미치는 영향을 평가한다.
  • 내림리샘플링 없이 또는 수동 파rameter 조정 없이도 전체 해상도 이미지를 처리할 수 있는 종단 간 엔드 투 엔드 다중 시야 딥 러닝 시스템을 구축한다.
  • 영상 해부학적 세부 정보를 유지하면서 영상 분석을 보조하여 정상 여부 또는 추가 검사 필요 여부를 자동으로 분류함으로써 방사선과의 업무를 지원한다.
  • 수만 장의 고해상도 DBT 영상을 활용하여 강력한 분류 모델을 훈련시키는 것이 가능한지를 평가한다.

제안 방법

  • 21,264건의 DBT 스크리닝 검사에서 유도된 82,943장의 고해상도 합성 2차원 유방 조영 영상으로 다중 시야 컨volution 네트워크(MV-CNN)를 훈련시켰다.
  • 정위(CC) 및 사타구리측면(MLO) 영상을 별도로 처리한 후 융합하여 분류하는 다중 시야 아키텍처를 사용했다.
  • 훈련 전반에 걸쳐 원본 이미지 해상도를 유지하여 미세한 해부학적 세부 정보를 손실 없이 보존했다.
  • 전역 평균 풀링과 소프트맥스 분류를 적용하여 각 케이스를 BI-RADS 0, 1, 또는 2 클래스로 할당했다.
  • 보류된 테스트 세트에서 수신기 작동 특성 곡선 아래 면적(AUC), 정확도, 재현율, 정밀도를 사용해 모델 성능을 평가했다.
  • 훈련 데이터셋 크기(25%, 50%)와 이미지 해상도(1/4×, 1/2×)를 체계적으로 감소시켜 병용 분석을 수행하여 모델의 강건성 평가를 수행했다.

실험 결과

연구 질문

  • RQ1다중 시야 딥 컨volution 네트워크는 DBT에서 유도된 고해상도 합성 유방 조영 영상을 BI-RADS 분류 체계로 높은 성능으로 분류할 수 있는가?
  • RQ2훈련 데이터셋 크기를 줄일 경우 모델의 분류 성능에 어떤 영향을 미치는가?
  • RQ3이미지 해상도가 정상과 이상 케이스를 구분하는 데 모델의 능력에 어떤 영향을 미치는가?
  • RQ4내림리샘플링 없이 또는 사용자 정의 파rameter 없이도 모델이 높은 성능을 유지할 수 있는가?
  • RQ5모델의 예측 결과가 방사선과의 평가 결과와 AUC, 재현율, 정밀도 측면에서 어떻게 비교되는가?

주요 결과

  • MV-CNN는 BI-RADS 0(정상) 대비 비-BI-RADS 0(이상 또는 추가 검사 필요)를 분류하는 데 AUC 0.912를 기록했으며, 정확도 84.8%, 재현율 95.9%, 정밀도 95.0%를 기록했다.
  • 훈련 데이터셋 크기를 50%로 줄였을 경우 AUC가 유의미하게 0.877로 감소했고(p=0.010), 25%로 줄였을 경우 AUC=0.834로 감소했으며(p=0.009), 데이터 양에 강하게 의존함을 시사했다.
  • 이미지 해상도를 1/2로 줄였을 경우 AUC가 0.870으로 감소했고(p=0.011), 1/4로 줄였을 경우 AUC=0.813으로 감소했으며(p=0.009), 이는 해상도에 민감함을 보여주었다.
  • 내림리샘플링으로 인해 컨볼루션 커널 크기보다 작은 특징 맵이 발생하면서 일부 레이어가 건너뛰어지는 현상이 발생했고, 이로 인해 성능 저하가 발생했다.
  • 모델의 색채지도는 예측에 가장 기여한 이상 케이스의 영역을 강조하여 해석 가능성(해석 가능성)을 뒷받침했다.
  • 이 연구는 높은 성능을 달성하기 위해 수만 장의 고해상도 영상을 필요로 하며, 데이터 양과 해상도가 모두 핵심 요소임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.