Skip to main content
QUICK REVIEW

[논문 리뷰] A Systematic Collection of Medical Image Datasets for Deep Learning

Johann Li, Guangming Zhu|arXiv (Cornell University)|2021. 06. 24.
Radiomics and Machine Learning in Medical Imaging참고 문헌 193인용 수 9
한 줄 요약

이 논문은 2013~2020년 동안 네 가지 분야인 두경부, 흉부 및-abdomen, 병리 및 혈액, 기타에서 300개 이상의 의료 영상 데이터셋 및 챌린지의 체계적이고 철저히 정제된 컬렉션을 제시한다. 이는 연구자들이 관련 데이터셋을 식별하고, 방법을 견고하게 평가하며, 챌린지 랭킹을 접근할 수 있도록 하여 의료 딥러닝 분야에서의 데이터 부족과 접근성 장벽을 해결한다.

ABSTRACT

The astounding success made by artificial intelligence (AI) in healthcare and other fields proves that AI can achieve human-like performance. However, success always comes with challenges. Deep learning algorithms are data-dependent and require large datasets for training. The lack of data in the medical imaging field creates a bottleneck for the application of deep learning to medical image analysis. Medical image acquisition, annotation, and analysis are costly, and their usage is constrained by ethical restrictions. They also require many resources, such as human expertise and funding. That makes it difficult for non-medical researchers to have access to useful and large medical data. Thus, as comprehensive as possible, this paper provides a collection of medical image datasets with their associated challenges for deep learning research. We have collected information of around three hundred datasets and challenges mainly reported between 2013 and 2020 and categorized them into four categories: head & neck, chest & abdomen, pathology & blood, and ``others''. Our paper has three purposes: 1) to provide a most up to date and complete list that can be used as a universal reference to easily find the datasets for clinical image analysis, 2) to guide researchers on the methodology to test and evaluate their methods' performance and robustness on relevant datasets, 3) to provide a ``route'' to relevant algorithms for the relevant medical topics, and challenge leaderboards.

연구 동기 및 목표

  • 의료 영상 분석 분야에서의 데이터 부족이라는 핵심적 장애요인을 해결하기 위해, 포괄적이고 최신 상태이며 접근 가능한 데이터셋 및 챌린지 목록을 구축하는 것.
  • 연구자들이 특정 임상 영상 분석 작업(예: MRI 또는 CT에서의 종양 세그멘테이션)에 적합한 데이터셋을 효과적으로 선택하고 평가 및 벤치마킹할 수 있도록 안내하는 것.
  • 연구 및 개발을 가속화하기 위해 데이터셋, 챌린지, 관련 알고리즘 간의 탐색 가능한 참조 자료를 제공하는 것.
  • 공개 가능하고 윤리적으로 준수 가능한 데이터셋 및 챌린지 플랫폼를 종합함으로써 데이터 접근성 및 표준화 장벽을 극복하는 것.
  • 벤치마킹 플랫폼 및 랭킹을 집계함으로써 의료 AI 연구의 재현성과 비교 가능성 향상을 지원하는 것.

제안 방법

  • 주요 컫퍼런스 및 기관에서 2013년부터 2020년까지 보고된 300개 이상의 의료 영상 데이터셋 및 챌린지를 체계적으로 수집하고 정제한 바.
  • 解剖학적 및 임상적 관련성에 기반해 데이터셋을 네 가지 주제 그룹으로 분류: 두경부, 흉부 및 복부, 병리 및 혈액, 기타.
  • 영상 모odal리티, 작업 유형(예: 분류, 세그멘테이션), 샘플 수, 표준화 품질 등 각 데이터셋에 대한 상세한 메타데이터 제공.
  • 관련 챌린지(MICCAI, ISBI, AAPM 등)와 데이터셋을 매핑하고, 챌린지 랭킹 및 공개 저장소에 대한 링크 포함.
  • 데이터 효율적 학습을 위한 주요 방법론을 검토하고 요약: 전이 학습, 소수 샘플 학습, 활성 학습, 피어드레이티드 학습.
  • 영상의학 보고서를 활용한 자연어 처리 기법이 수동 레이블링 부담을 줄이기 위해 반자동 데이터 표준화를 지원하는 역할을 설명.

실험 결과

연구 질문

  • RQ1의료 영상 분석 분야의 딥러닝 연구를 위한 가장 포괄적이고 최신의 의료 영상 데이터셋 및 챌린지 컬렉션은 무엇인가?
  • RQ2연구자들은 특정 의료 영상 작업(예: MRI 또는 CT에서의 종양 세그멘테이션)에 적합한 데이터셋을 어떻게 효율적으로 식별하고 접근할 수 있는가?
  • RQ3의료 영상 분석에서 데이터 부족과 표준화 장벽을 극복하기 위한 가장 효과적인 전략은 무엇인가?
  • RQ4벤치마킹 플랫폼 및 챌린지 랭킹은 의료 영상에서 딥러닝 모델의 평가 및 재현성 향상에 어떻게 기여하는가?
  • RQ5피어드레이티드 학습 및 활성 학습과 같은 신기술은 개인정보 보호 및 비용 효율적인 모델 훈련을 어떻게 가능하게 하는가?

주요 결과

  • 연구는 2013년부터 2020년까지 다양한 해부학적 영역과 영상 모달리티를 포함한 300개 이상의 의료 영상 데이터셋 및 챌린지를 수집하고 정리하였다.
  • 데이터셋은 두경부, 흉부 및 복부, 병리 및 혈액, 기타의 네 가지 주요 주제로 체계적으로 분류되어 검색성과 사용성 향상에 기여하였다.
  • 저자는 MICCAI, ISBI, AAPM에서 주최하는 챌린지가 의료 영상 분야에서 딥러닝 모델의 벤치마킹 및 평가를 위한 핵심 플랫폼임을 확인하였다.
  • 의료 영상에서 낮은 데이터 환경에서의 적응을 위해 사전 학습된 모델을 활용한 전이 학습 및 파인튜닝이 매우 효과적인 것으로 나타났다.
  • 활동 학습과 피어드레이티드 학습은 표준화 비용 감소 및 데이터 프라이버시 유지에 있어 유망한 접근법으로 확인되었다.
  • 영상의학 보고서를 활용한 자연어 처리 기법이 반자동 표준화를 지원하여 전문가 레이블 기반 데이터 의존도를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.