Skip to main content
QUICK REVIEW

[논문 리뷰] WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image

Xiangde Luo, Wenjun Liao|arXiv (Cornell University)|2021. 11. 03.
Radiomics and Machine Learning in Medical Imaging인용 수 11
한 줄 요약

이 논문은 150개의 Abdominal CT 볼륨과 16개의 기관을 픽셀 수준 및 스크래치(annotation)로 세분화한 대규모 임상 데이터셋인 WORD를 소개한다. 이는 전복부 기관 세분화를 위한 딥러닝 모델의 벤치마킹을 가능하게 한다. 연구 결과, 최신 모델과 임상 전문의 간에 소형 복잡 기관에서 뚜렷한 성능 격차가 있음을 확인하였으며, 임상 적용을 위한 보다 효율적인 애너테이션 및 일반화 능력을 갖춘 방법의 필요성을 강조한다.

ABSTRACT

Whole abdominal organ segmentation is important in diagnosing abdomen lesions, radiotherapy, and follow-up. However, oncologists' delineating all abdominal organs from 3D volumes is time-consuming and very expensive. Deep learning-based medical image segmentation has shown the potential to reduce manual delineation efforts, but it still requires a large-scale fine annotated dataset for training, and there is a lack of large-scale datasets covering the whole abdomen region with accurate and detailed annotations for the whole abdominal organ segmentation. In this work, we establish a new large-scale extit{W}hole abdominal extit{OR}gan extit{D}ataset ( extit{WORD}) for algorithm research and clinical application development. This dataset contains 150 abdominal CT volumes (30495 slices). Each volume has 16 organs with fine pixel-level annotations and scribble-based sparse annotations, which may be the largest dataset with whole abdominal organ annotation. Several state-of-the-art segmentation methods are evaluated on this dataset. And we also invited three experienced oncologists to revise the model predictions to measure the gap between the deep learning method and oncologists. Afterwards, we investigate the inference-efficient learning on the WORD, as the high-resolution image requires large GPU memory and a long inference time in the test stage. We further evaluate the scribble-based annotation-efficient learning on this dataset, as the pixel-wise manual annotation is time-consuming and expensive. The work provided a new benchmark for the abdominal multi-organ segmentation task, and these experiments can serve as the baseline for future research and clinical application development.

연구 동기 및 목표

  • 다양한 기관 세분화를 위한 대규모, 고품질, 전복부 CT 데이터셋이 부족한 문제를 해결하기 위해.
  • 실제 임상 데이터를 활용하여 전복부 세분화에 대한 딥러닝 모델 평가를 위한 표준화된 벤치마크를 수립하기 위해.
  • 경험이 풍부한 종양학 전문의의 예측과 비교함으로써 딥러닝 모델의 임상 적용 가능성을 탐구하기 위해.
  • 라벨링 비용을 줄이기 위해 희박한 스크래치 애너테이션을 활용한 애너테이션 효율성 향상 학습 방법을 탐색하기 위해.
  • 다양한 데이터셋 간의 일반화 능력을 평가하여 복부 세분화에서의 도메인 갭을 규명하기 위해.

제안 방법

  • 150개의 CT 볼륨을 포함한 대규모 실재 임상 데이터셋(WORD)을 구축하였으며, 각 볼륨은 16개의 기관을 픽셀 수준 및 스크래치로 애너테이션 처리하였다.
  • 방사선종양학 전문의와 방사선과 전문의의 정밀 검증을 거친 30,495장의 슬라이스에 대한 세분화된 전문 애너테이션을 통합하였다.
  • WORD 벤치마크에서 12개의 최신 세분화 모델을 평가하여 성능 및 임상 적용 가능성 여부를 분석하였다.
  • 3명의 신규 종양학 전문의를 대상으로 사용자 연구를 수행하여 모델 예측을 수정하고, 모델 출력과 임상 기준 간 격차를 정량화하였다.
  • 엔트로피를 최소화하고 내부 클래스 강도 분산을 줄이는 스크래치 기반 학습 방법을 제안하여 애너테이션 효율성을 향상시켰다.
  • WORD, BTCV, TCIA, 외부 LiTS 데이터셋에서의 성능 비교를 통해 도메인 일반화 능력을 평가하고 도메인 이동 문제를 규명하였다.

실험 결과

연구 질문

  • RQ1세분화에 대한 세부 기관 애너테이션이 있는 대규모 전복부 CT 데이터셋에서 최신 딥러닝 모델의 성능은 어떠한가?
  • RQ2특히 소형 복잡 기관에 대해 딥러닝 모델의 예측이 수정 없이 임상적으로 수용 가능한가?
  • RQ3스크래치 기반 약한 지도 학습은 라벨링 비용을 줄이면서도 세분화 성능을 유지하는 데 얼마나 효과적인가?
  • RQ4WORD와 BTCV, TCIA와 같은 공개 데이터셋 간의 도메인 격차의 크기는 얼마이며, 이는 모델의 일반화 능력에 어떤 영향을 미치는가?
  • RQ5실제 임상 워크플로우에서 복부 다기능 기관 세분화를 위한 딥러닝 모델을 구현하는 데 있어 주요 과제는 무엇인가?

주요 결과

  • 최신 모델은 간, 비장, 신장과 같은 대형 기관에서 높은 성능을 달성하여 종양학 전문의의 미세한 수정 후 임상적으로 수용 가능하다.
  • 담낭,食도, 췌장, 소장과 같은 소형 복잡 기관에서 모델과 종양학 전문의 사이에 뚜렷한 성능 격차가 존재하여 임상적 준비가 부족함을 시사한다.
  • 스크래치 기반 학습 방법은 기준 모델 대비 성능 향상을 보였지만, 밀도 높은 애너테이션 성능에 못 미치며, 애너테이션 효율성 향상 분야에 여전히 개선 여지가 있음을 보여준다.
  • WORD 데이터셋과 BTCV, TCIA와 같은 공개 데이터셋 간에 상당한 도메인 격차가 존재하여, 한 곳에서 학습된 모델이 다른 데이터셋에 일반화되는데 어려움이 있음을 시사한다.
  • WORD 데이터셋은 종합적인 애너테이션이 있는 최초의 대규모 전복부 다기능 기관 데이터셋으로, 향후 연구를 위한 공정한 벤치마크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.