Skip to main content
QUICK REVIEW

[논문 리뷰] Detection of masses and architectural distortions in digital breast tomosynthesis: a publicly available dataset of 5,060 patients and a deep learning model

Mateusz Buda, Ashirbani Saha|arXiv (Cornell University)|2020. 11. 13.
AI in cancer detection참고 문헌 19인용 수 9
한 줄 요약

이 논문은 방사선의학자가 질병 소견과 구조적 왜곡을 주석 처리한 5,060명의 환자, 총 22,032개의 디지털 유방 단층촬영(DBT) 영상 자료를 포함하는 공개된 데이터셋을 소개하며, 이러한 이상소견을 탐지하기 위한 단일 단계 딥러닝 모델을 제시한다. 이 모델은 1인당 2개의 위양성 결과에서 65%의 민감도를 달성하여 향후 DBT 스크리닝 분야의 인공지능 개발을 위한 기준선을 설정한다.

ABSTRACT

Breast cancer screening is one of the most common radiological tasks with over 39 million exams performed each year. While breast cancer screening has been one of the most studied medical imaging applications of artificial intelligence, the development and evaluation of the algorithms are hindered due to the lack of well-annotated large-scale publicly available datasets. This is particularly an issue for digital breast tomosynthesis (DBT) which is a relatively new breast cancer screening modality. We have curated and made publicly available a large-scale dataset of digital breast tomosynthesis images. It contains 22,032 reconstructed DBT volumes belonging to 5,610 studies from 5,060 patients. This included four groups: (1) 5,129 normal studies, (2) 280 studies where additional imaging was needed but no biopsy was performed, (3) 112 benign biopsied studies, and (4) 89 studies with cancer. Our dataset included masses and architectural distortions which were annotated by two experienced radiologists. Additionally, we developed a single-phase deep learning detection model and tested it using our dataset to serve as a baseline for future research. Our model reached a sensitivity of 65% at 2 false positives per breast. Our large, diverse, and highly-curated dataset will facilitate development and evaluation of AI algorithms for breast cancer screening through providing data for training as well as common set of cases for model validation. The performance of the model developed in our study shows that the task remains challenging and will serve as a baseline for future model development.

연구 동기 및 목표

  • 디지털 유방 단층촬영(DBT)의 유방암 스크리닝 분야에서 대규모, 정확하게 주석 처리된, 공개 가능한 데이터셋의 부족을 해결하기 위해.
  • DBT 영상에서 종양과 구조적 왜곡을 탐지하기 위한 강력한 단일 단계 딥러닝 모델을 개발하기 위해.
  • DBT에서의 인공지능 모델 훈련 및 평가를 위한 표준화된 기준선을 제공하여 연구 간 재현성과 비교 가능성 향상시키기 위해.
  • 임상 데이터에 직접 접근할 수 없는 연구자들을 지원하기 위해 공유되고 다양한 성향을 가진 데이터셋을 활용한 훈련 및 검증을 가능하게 하기 위해.

제안 방법

  • 데이터셋은 2014년 1월부터 2018년 1월까지 Duke Health System의 DEDUCE 도구에서 추출한 DBT 영상 자료를 바탕으로 하였으며, 방사선과 및 병리 보고서에 'tomosynthesis' 또는 'breast'가 포함된 자료를 대상으로 하였다.
  • 모든 DBT 영상 자료는 재구성되고 익명화되었으며, 5,060명의 환자로부터 총 22,032건의 영상 자료가 정상, 추가 영상 필요, 양성 생검, 암의 네 가지 범주로 분류되었다.
  • 두 명의 숙련된 방사선의사가 독립적으로 DBT 영상 자료 내 종양과 구조적 왜곡을 주석 처리하여, 모델 훈련 및 평가를 위한 고품질의 진실값을 확보하였다.
  • 심각한 클래스 불균형 문제를 해결하기 위해 포칼 손실(focal loss)을 사용한 단일 단계 3차원 컨volutional 신경망을 훈련시켰으며, mammography 데이터에 대한 사전 훈련은 실시하지 않았다.
  • 모델 평가는 영상 단위의 탐지 프레임워크를 사용하였으며, 예측된 경계 상자(Bounding box)가 진실값 중심점을 완전히 포함하는 경우에만 참 긍정(True positive)으로 간주하였다.
  • 성능 평가는 자유반응 수신기 작동 특성(Free-response receiver operating characteristic, FROC) 곡선을 사용하였으며, 영상 기반 및 유방 기반 평가 지표를 모두 적용하였다.

실험 결과

연구 질문

  • RQ1전문가 주석 처리된 종양과 구조적 왜곡을 포함한 대규모 공개 DBT 데이터셋은 딥러닝 기반 유방암 스크리닝 연구의 재현성 향상에 기여하는가?
  • RQ2제한된 훈련 데이터로도 DBT 영상에서 종양과 구조적 왜곡을 동시에 탐지하기 위한 단일 단계 딥러닝 모델의 효과성은 어떠한가?
  • RQ3DBT에서 극심한 클래스 불균형 상황에서, 124건의 암 병변과 175건의 양성 병변만을 고려할 때 최적의 탐지 성능를 달성하기 위해 어떤 손실 함수가 가장 효과적인가?
  • RQ4동일한 평가 프rotocol 하에서, mammography 데이터로 사전 훈련된 모델과 DBT 데이터로만 훈련된 모델의 성능는 어떻게 비교되는가?
  • RQ5정상 및 임상적으로 유의미한 병변을 포함함으로써, 기준선 데이터셋의 임상적 현실성과 일반화 능력은 어느 정도 향상되는가?

주요 결과

  • 총 22,032건의 DBT 영상 자료가 5,060명의 환자로부터 확보되었으며, 이 중 정상 5,129건, 추가 영상 필요 280건, 양성 생검 112건, 암 89건이 포함되었다.
  • 포칼 손실을 사용해 훈련한 딥러닝 모델은 테스트 세트에서 1유방당 2개의 위양성 결과에서 65%의 민감도를 기록하였으며, 암 병변에 대해서는 67%의 민감도를 보였다.
  • 테스트 세트에서 DBT 영상 단위 평가에서는 1영상당 2개의 위양성 결과에서 42%의 민감도를 기록하여, 훈련 예제가 제한된 상황에서도 중간 수준의 성능를 보였다.
  • 포칼 손실은 이진 교차 엔트로피와 가중 이진 교차 엔트로피보다 우수한 성능를 보였으며, 3차원 영상 단위 평가에서 1영상당 2개의 위양성 결과에서 60%의 민감도를 기록하였다.
  • 모델은 양성 병변보다는 암 병변에서 더 높은 성능를 보였으며(1유방당 2개의 위양성 결과에서 민감도 67%), 비악성이지만 임상적으로 조치가 필요한 병변 탐지의 어려움을 반영하고 있다.
  • 엄격한 겹침 기준(중심점 포함)을 적용한 3차원 영상 단위 평가 방식은 중심 기반 지표에 비해 큰 경계 상자 예측에 대해 더 뛰어난 내구성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.