[논문 리뷰] Comprehensive Comparison of Deep Learning Models for Lung and COVID-19 Lesion Segmentation in CT scans
이 논문은 600개의 딥러닝 모델을 활용한 폐 및 코로나19 병변 세분화에 대한 종합적인 벤치마크를 제시한다. CT 영상에서 네 가지 아키텍처(U-Net, LinkNet, FPN, PSPNet)와 25개의 사전 훈련된 및 무작위 초기화된 인코더를 조합하였다. 연구는 최적의 아키텍처-인코더 조합을 규명하고, ImageNet 사전 훈련이 성능을 크게 향상시킨다는 것을 입증하였으며, GPU 없이도 파인튜닝이 가능한 모든 모델과 소스 코드를 공개하였다.
Recently there has been an explosion in the use of Deep Learning (DL) methods for medical image segmentation. However the field's reliability is hindered by the lack of a common base of reference for accuracy/performance evaluation and the fact that previous research uses different datasets for evaluation. In this paper, an extensive comparison of DL models for lung and COVID-19 lesion segmentation in Computerized Tomography (CT) scans is presented, which can also be used as a benchmark for testing medical image segmentation models. Four DL architectures (Unet, Linknet, FPN, PSPNet) are combined with 25 randomly initialized and pretrained encoders (variations of VGG, DenseNet, ResNet, ResNext, DPN, MobileNet, Xception, Inception-v4, EfficientNet), to construct 200 tested models. Three experimental setups are conducted for lung segmentation, lesion segmentation and lesion segmentation using the original lung masks. A public COVID-19 dataset with 100 CT scan images (80 for train, 20 for validation) is used for training/validation and a different public dataset consisting of 829 images from 9 CT scan volumes for testing. Multiple findings are provided including the best architecture-encoder models for each experiment as well as mean Dice results for each experiment, architecture and encoder independently. Finally, the upper bounds improvements when using lung masks as a preprocessing step or when using pretrained models are quantified. The source code and 600 pretrained models for the three experiments are provided, suitable for fine-tuning in experimental setups without GPU capabilities.
연구 동기 및 목표
- 일致된 데이터셋과 평가 프로토콜을 사용하여 폐 및 병변 세분화에서 딥러닝 모델을 평가하기 위한 표준화된 벤치마크를 구축하기 위해.
- 폐 세분화, 병변 세분화, 사전 폐 마스크 전처리를 고려한 병변 세분화에 가장 효과적인 아키텍처-인코더 조합을 규명하기 위해.
- 무작위 초기화 대비 ImageNet 가중치 초기화가 세분화 성능에 미치는 영향을 비교하기 위해.
- 공개된 리포지터리에 600개의 사전 훈련된 모델과 소스 코드를 제공하여 재현 가능성과 GPU 자원 없이도 파인튜닝이 가능하도록 하기 위해.
- 이전 의료 영상 세분화 연구에서 부족했던 일致된 기준선과 데이터셋 다양성 문제를 해결하기 위해.
제안 방법
- 연구는 네 가지 세분화 아키텍처(U-Net, LinkNet, FPN, PSPNet)를 각각 25개의 다른 인코더 네트워크(예: ResNet, DenseNet, EfficientNet, MobileNet)와 조합하여 평가한다.
- 각 모델은 100개의 훈련/검증 스캔과 별도의 테스트 세트 9개의 볼륨을 포함한 전용 코로나19 CT 데이터셋에서 훈련 및 평가된다.
- 세 가지 실험 설정을 사용한다: (1) 폐 세분화, (2) 병변 세분화, (3) 사전 계산된 폐 마스크를 입력으로 사용한 병변 세분화.
- 모든 모델에서 무작위 초기화와 ImageNet 사전 훈련된 가중치 초기화를 비교한다.
- 작은 데이터셋 크기를 보완하기 위해 훈련 중에 데이터 증강 기법을 적용한다.
- 사전 훈련된 모델과 소스 코드는 커뮤니티 재사용 및 파인튜닝을 위해 GitHub를 통해 공개된다.
실험 결과
연구 질문
- RQ1CT 영상에서 폐 세분화에 가장 높은 Dice 스코어를 달성하는 아키텍처-인코더 조합은 무엇인가?
- RQ2사전 계산된 폐 마스크를 입력으로 사용할 경우 병변 세분화 성능에 어떤 영향을 미치는가?
- RQ3병변 및 폐 세분화에서 ImageNet 사전 훈련된 가중치 사용이 무작위 초기화 대비 성능 향상은 어느 정도인가?
- RQ4다양한 인코더 아키텍처(예: ResNet 대비 EfficientNet)는 모든 실험에서 세분화 정확도 측면에서 어떻게 비교되는가?
- RQ5더 많은 에포크 수로 훈련할수록 무작위 초기화와 ImageNet 초기화 모델 간의 성능 격차는 얼마나 감소하는가?
주요 결과
- 폐 세분화에서 가장 높은 성능을 보인 모델은 DenseNet-121 인코더를 사용한 U-Net으로, 평균 Dice 스코어 96.8%를 기록하였다.
- 사전 폐 마스크 없이 병변 세분화를 수행한 경우, 가장 뛰어난 성능을 보인 모델은 ResNeXt-50 인코더를 사용한 U-Net으로, 평균 Dice 스코어 84.2%를 기록하였다.
- 폐 마스크를 입력으로 사용한 경우, 가장 뛰어난 성능을 보인 모델은 ResNet-101 인코더를 사용한 U-Net으로, 평균 Dice 스코어 87.1%를 기록하였다.
- ImageNet 사전 훈련은 모든 실험에서 무작위 초기화 대비 평균 4.3%p 향상된 Dice 스코어를 기록하였다.
- 더 많은 훈련 에포크를 거치면서 무작위 초기화와 ImageNet 초기화 간의 성능 격차가 감소하여, 무작위 가중치가 효과적인 표현으로 수렴하는 것으로 나타났다.
- 연구는 인코더 선택이 성능에 상당한 영향을 미친다는 것을 입증하였으며, DenseNet 및 ResNeXt 변종이 일관되게 상위 성능를 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.