Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Context Enhanced Region-based Convolutional Neural Network for End-to-End Lesion Detection

Ke Yan, Mohammadhadi Bagheri|arXiv (Cornell University)|2018. 06. 25.
Radiomics and Machine Learning in Medical Imaging참고 문헌 11인용 수 6
한 줄 요약

이 논문은 복수의 인접한 CT 슬라이스에서 특징 맵을 집계하여 2D 영역 기반 CNN에 3D 컨텍스트를 통합함으로써 메모리 효율적이고 엔드 투 엔드인 딥러닝 프레임워크인 3D Context Enhanced Region-based CNN(3DCE)을 제안한다. 사전 훈련된 2D 백본과 2D 바운딩 박스 애너테이션을 활용함으로써, 3DCE는 DeepLesion 데이터셋에서 1장당 4개의 가짜 양성 결과를 기준으로 병변 탐지 민감도를 4.05% 향상시켰다(80.32%에서 84.37%로). 이는 3D CNN과 이중 단계 FPR 방법을 모두 능가하는 성능이다.

ABSTRACT

Detecting lesions from computed tomography (CT) scans is an important but difficult problem because non-lesions and true lesions can appear similar. 3D context is known to be helpful in this differentiation task. However, existing end-to-end detection frameworks of convolutional neural networks (CNNs) are mostly designed for 2D images. In this paper, we propose 3D context enhanced region-based CNN (3DCE) to incorporate 3D context information efficiently by aggregating feature maps of 2D images. 3DCE is easy to train and end-to-end in training and inference. A universal lesion detector is developed to detect all kinds of lesions in one algorithm using the DeepLesion dataset. Experimental results on this challenging task prove the effectiveness of 3DCE. We have released the code of 3DCE in https://github.com/rsummers11/CADLab/tree/master/lesion_detector_3DCE.

연구 동기 및 목표

  • CT 스캔에서 진정한 병변과 비병변을 구분하는 데 있어 3D 컨텍스트가 핵심적이지만 기존 2D 기반 엔드 투 엔드 탐지기에서 이를 충분히 활용하지 못하는 문제를 해결하기 위해.
  • 3D CNN이나 3D 바운딩 박스 애너테이션을 요구하지 않으면서도 3D 컨텍스트를 통합하는 메모리 효율적이고 엔드 투 엔드인 딥러닝 프레임워크를 개발하기 위해.
  • 대규모 DeepLesion 데이터셋을 기반으로 훈련된 단일 통합 모델을 통해 다양한 병변 유형에 대한 보편적 병변 탐지 기능을 제공하기 위해.
  • 3D CNN을 처음부터 훈련시킬 필요 없이 사전 훈련된 2D CNN 가중치(예: VGG-16)를 활용한 전이 학습을 통해 성능을 향상시키기 위해.

제안 방법

  • 3DCE는 M개의 인접한 CT 슬라이스를 M개의 3채널 이미지로 묶어 2D CNN과의 입력 호환성을 유지한다.
  • 각 슬라이스에 대해 2D 영역 기반 완전 컨volution 네트워크(R-FCN)를 적용하여 특징 맵을 생성하고, 이를 슬라이스 간 공간적으로 집계하여 3D 컨텍스트를 인코딩한다.
  • 이웃 슬라이스의 특징 맵을 연결하고, 분류 및 회귀를 위한 추가적인 완전 연결 및 ReLU 레이어를 갖춘 공유된 개선된 R-FCN 헤드를 통해 처리한다.
  • 소규모 병변을 위해 공간 해상도를 유지하기 위해 풀링 레이어를 줄인 수정된 VGG-16 백본을 사용한다.
  • 3D 애너테이션이나 이중 단계 FPR 파이프라인을 필요로 하지 않고, 오직 2D 바운딩 박스 애너테이션만을 사용하여 엔드 투 엔드 훈련과 추론을 가능하게 한다.
  • 프레임워크는 확장 가능하고 효율적이며, 추론 시간이 입력 슬라이스 수에 비례하게 선형적으로 증가하고, 볼륨 데이터에서 특징 맵 캐싱의 이점을 얻는다.

실험 결과

연구 질문

  • RQ13D 컨텍스트를 3D 컨볼루션 레이어나 3D 애너테이션을 요구하지 않고 2D 영역 기반 CNN에 효과적으로 통합할 수 있는가?
  • RQ2다중 2D 슬라이스의 특징 맵 수준 융합이 데이터 수준 융합이나 3D CNN보다 병변 탐지 민감도 향상에 기여하는가?
  • RQ3다양한 병변 유형을 기반으로 훈련된 단일 통합 모델이 오직 2D 바운딩 박스 애너테이션과 사전 훈련된 2D 모델만을 사용해도 높은 성능을 달성할 수 있는가?
  • RQ43DCE는 이중 단계 FPR 방법과 3D CNN에 비해 민감도, 훈련 효율성, 메모리 사용 측면에서 어떻게 비교되는가?

주요 결과

  • 3DCE는 DeepLesion 테스트 세트에서 1장당 4개의 가짜 양성 결과 기준 병변 탐지 민감도를 80.32%에서 84.37%로 향상시켰으며, 병변 유형 간 일관된 성능 향상을 보였다.
  • 9개의 입력 슬라이스를 사용할 경우 4 FPs당 민감도 84.34%를 달성했고, 27개 슬라이스를 사용할 경우 4 FPs에서 85.65%를 기록하여 컨텍스트 깊이에 따라 확장 가능성을 입증했다.
  • 3D CNN을 처음부터 훈련한 모델(1장당 4 FPs에서 민감도 79.7%)보다 사전 훈련된 2D 가중치와 분해된 3D 특징 맵 융합을 활용함으로써 3DCE가 뛰어난 성능을 보였다.
  • 추가적인 완전 연결 및 ReLU 레이어를 갖춘 개선된 R-FCN 백본은 원래 R-FCN 대비 정확도를 0.7% 향상시켰지만, 유사한 추론 속도를 유지했다.
  • 11개 슬라이스를 사용한 데이터 수준 융합(4 FPs에서 민감도 83.02%)과 더 빠른 RCNN(4 FPs에서 민감도 81.62%)보다 3DCE가 뛰어난 성능을 보였으며, 특징 수준 융합의 우월성을 확인했다.
  • 공식 DeepLesion 데이터 분할(4,817장)에서 3DCE는 1장당 16개의 가짜 양성 결과에서 민감도 89.62%를 기록했고, 4 FPs에서는 84.34%를 달성했으며, 병변 유형과 직경에 관계없이 일관된 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.