Skip to main content
QUICK REVIEW

[논문 리뷰] AbdomenCT-1K: Is Abdominal Organ Segmentation A Solved Problem?

Jun Ma, Yao Zhang|arXiv (Cornell University)|2020. 10. 28.
COVID-19 diagnosis using AI참고 문헌 101인용 수 14
한 줄 요약

이 논문은 12개의 병원에서 수집한 1,000건의 촬영 영상으로 구성된 대규모이며 다양한 복부 CT 데이터셋인 AbdomenCT-1K을 소개한다. 이 데이터셋은 다단계, 다제조업체, 다질환 사례를 포함한다. 기존 벤치마크에서 최고 성능을 기록한 상태의 기술(SOTA) 방법들이라도 다양한 임상 환경에서 일반화하지 못하는 것으로 드러나, 이에 대응해 완전 지도, 준지도, 약한 지도, 지속 학습을 포함한 네 가지 새로운 벤치마크와 실제 임상 문제를 해결하기 위한 강력한 즉시 사용 가능한 베이스라인을 제작하였다.

ABSTRACT

With the unprecedented developments in deep learning, automatic segmentation of main abdominal organs seems to be a solved problem as state-of-the-art (SOTA) methods have achieved comparable results with inter-rater variability on many benchmark datasets. However, most of the existing abdominal datasets only contain single-center, single-phase, single-vendor, or single-disease cases, and it is unclear whether the excellent performance can generalize on diverse datasets. This paper presents a large and diverse abdominal CT organ segmentation dataset, termed AbdomenCT-1K, with more than 1000 (1K) CT scans from 12 medical centers, including multi-phase, multi-vendor, and multi-disease cases. Furthermore, we conduct a large-scale study for liver, kidney, spleen, and pancreas segmentation and reveal the unsolved segmentation problems of the SOTA methods, such as the limited generalization ability on distinct medical centers, phases, and unseen diseases. To advance the unsolved problems, we further build four organ segmentation benchmarks for fully supervised, semi-supervised, weakly supervised, and continual learning, which are currently challenging and active research topics. Accordingly, we develop a simple and effective method for each benchmark, which can be used as out-of-the-box methods and strong baselines. We believe the AbdomenCT-1K dataset will promote future in-depth research towards clinical applicable abdominal organ segmentation methods. The datasets, codes, and trained models are publicly available at https://github.com/JunMa11/AbdomenCT-1K.

연구 동기 및 목표

  • 현재 최고 성능을 내는 복부 장기 분할을 위한 딥러닝 기법들이 다양한 임상 환경(다른 스캐너, 촬영 단계, 질환 유형 포함)에서 잘 일반화되는지 조사하기 위해.
  • 실제 임상에서의 변동성을 반영한 대규모이며 다양한 공개 데이터셋의 부족을 해결하기 위해.
  • 준지도, 약한 지도, 지속 학습 설정을 포함한 annotation 효율적이고 견고한 분할을 위한 새로운 벤치마크를 개발하고 검증하기 위해.
  • 새로운 벤치마크 각각에 대해 연구를 신속하게 진행할 수 있도록 강력한 즉시 사용 가능한 베이스라인 모델을 제공하기 위해.

제안 방법

  • 12개의 의료 기관에서 수집한 1,000건의 복부 CT 영상 데이터를 수집하고 정제하였으며, 다양한 제조업체, 촬영 단계(arterial, portal venous, delayed) 및 질환 유형(희귀 및 심각한 병변 포함)을 포함한다.
  • 완전 지도, 준지도, 약한 지도, 지속 학습을 포함한 네 가지 별도의 분할 벤치마크를 구성하였으며, 각각 다양한 기관과 스캐너에서 수집된 테스트 세트를 포함한다.
  • 임상적 의미를 반영하기 위해 영역 기반(Dice Similarity Coefficient, DSC) 및 경계 기반(Hausdorff Distance, NSD) 메트릭을 강조하는 평가 프로토콜을 설계하였다.
  • 라벨 부족과 도메인 이동 문제를 다루기 위해 데이터 증강, 커리큘럼 학습, 가짜 레이블링 전략을 활용한 단순하지만 효과적인 베이스라인 모델을 각 벤치마크에 대해 개발하였다.
  • 8개의 추가 장기(예: 대동맥, 담낭, 부싘이명)와 663개의 가짜 레이블링된 종양을 포함한 50개의 추가 케이스를 통합하여 병변 수준의 분할 연구를 지원하였다.
  • 공통 테스트 세트 50건(NJU 데이터셋)을 통합하여 네 가지 벤치마크 간에 공정하고 직접 비교 가능한 평가를 가능하게 하였다.

실험 결과

연구 질문

  • RQ1기존의 최고 성능(SOTA) 복부 장기 분할 모델들이 훈련 중에 볼 수 없었던 다기관, 다단계, 다제조업체, 다질환 CT 영상에 효과적으로 일반화되는가?
  • RQ2표준 벤치마크를 넘어서 도전적이고 다양한, 임상적으로 현실적인 데이터 분포에서 현재의 SOTA 방법들이 어떻게 성능을 내는가?
  • RQ3실제 데이터 제약 조건 하에서 복부 장기 분할에서 완전 지도, 준지도, 약한 지도, 지속 학습 접근법 간의 상대적 성능 및 상호 간의 성능 트레이드오프는 어떠한가?
  • RQ4경계 기반 메트릭(예: NSD)은 영역 기반 메트릭(DSC)이 포착하지 못하는 국소적 한계를 외과 수술 계획 상황에서 어떻게 드러내는가?
  • RQ5준지도 및 지속 학습 분할과 같은 새로운 임상적으로 관련성이 높은 벤치마크에 대해 단순하면서도 효과적인 베이스라인 모델을 개발할 수 있는가?

주요 결과

  • SOTA 방법들은 표준 벤치마크에서는 높은 DSC(>95%)를 기록하지만, AbdomenCT-1K의 다양한 다기관, 다질환 케이스에서 성능이 크게 떨어지며, DSC는 낮아지고 NSD는 높아지는 경향을 보였다.
  • 완전 지도 학습에 361개의 레이블링된 케이스가 필요한 것과 비교해, 레이블링된 41개와 비레이블링된 800개의 케이스만으로도 준지도 학습 방법이 거의 동일한 성능을 달성하여 매우 높은 데이터 효율성을 입증하였다.
  • 약한 지도 학습 방법은 가장 낮은 성능를 보였지만, 최소한의 레이블링 노력으로 가능했으며, 정확도와 레이블링 비용 간의 상호 트레이드오프를 강조하였다.
  • 지속 학습 환경에서는 모델이 기존에 학습한 작업에 대해 치명적인 기억 상실을 보였으며, 특히 췌장 분할의 경우 새로운 데이터 분포에 노출되었을 때 성능 저하가 심했다.
  • 간 분할은 일관된 성능을 보이며 DSC와 NSD 분포가 좁았고, 췌장 분할은 병리학적 이질성으로 인해 낮은 점수와 높은 경계 오류를 보였다.
  • 공통 테스트 세트를 통해 완전 지도 학습 방법이 평균 DSC와 NSD에서 가장 뛰어난 성능를 기록했지만, 준지도 학습 방법은 성능과 레이블링 효율성 사이에서 매우 균형 잡힌 성능를 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.