Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Liver Segmentation Using an Adversarial Image-to-Image Network

Dong Yang, Daguang Xu|arXiv (Cornell University)|2017. 07. 25.
Radiomics and Machine Learning in Medical Imaging인용 수 17
한 줄 요약

이 논문은 3D CT 스캔에서 자동 3D 간장 분할을 위한 딥 적대적 이미지-이미지 네트워크(DI2IN-AN)를 제안한다. 이는 유니트 유사 인코더-디코더 아키텍처에 다중 수준 스킵 연결, 딥 서포비전, 그리고 적대적 훈련을 통합하여 경계 정확도를 향상시킨다. 1,000개 이상의 다양한 CT 볼륨으로 훈련된 이 방법은 평균 대칭 표면 거리(ASD) 1.90 mm와 덱스 계수 0.95의 최신 기술 수준 성능을 달성하며, 스캔당 1초 이내로 실행된다.

ABSTRACT

Automatic liver segmentation in 3D medical images is essential in many clinical applications, such as pathological diagnosis of hepatic diseases, surgical planning, and postoperative assessment. However, it is still a very challenging task due to the complex background, fuzzy boundary, and various appearance of liver. In this paper, we propose an automatic and efficient algorithm to segment liver from 3D CT volumes. A deep image-to-image network (DI2IN) is first deployed to generate the liver segmentation, employing a convolutional encoder-decoder architecture combined with multi-level feature concatenation and deep supervision. Then an adversarial network is utilized during training process to discriminate the output of DI2IN from ground truth, which further boosts the performance of DI2IN. The proposed method is trained on an annotated dataset of 1000 CT volumes with various different scanning protocols (e.g., contrast and non-contrast, various resolution and position) and large variations in populations (e.g., ages and pathology). Our approach outperforms the state-of-the-art solutions in terms of segmentation accuracy and computing efficiency.

연구 동기 및 목표

  • 복잡한 배경, 흐린 경계, 높은 해부학적 변동성이 있는 3D CT 볼륨에서 정확하고 효율적인 자동 간장 분할 문제를 해결하기 위해.
  • CRF나 그래프 컷과 같은 전통적 후처리 방법의 한계를 극복하기 위해, 저대비 영역에서 경계 누출 문제가 발생하는 문제를 해결하기 위해.
  • 이미지-이미지 네트워크에 적대적 훈련을 통합하여 딥 러닝 기반 분할 성능을 향상시키고, 구조적 세부 정보와 경계 정밀도를 향상시키기 위해.
  • 일반화 및 모델의 강건성을 향상시키기 위해 1,000개 이상의 다양한 3D CT 볼륨으로 구성된 대규모 데이터셋을 활용하기 위해.
  • 최소한의 추론 시간으로 높은 분할 정확도를 달성하여 임상 적용을 가능하게 하기 위해.

제안 방법

  • 3D 인코더-디코더 아키텍처를 사용한 딥 이미지-이미지 네트워크(DI2IN)를 적용하며, 공간 해상도를 유지하기 위해 3D 컨볼루션 및 이중선형 업샘플링 레이어를 사용한다.
  • 다중 수준에서 인코더 및 디코더 레이어의 특징을 연결하기 위해 스킵 연결을 사용하여 특징 재사용과 기울기 흐름을 향상시킨다.
  • 디코더 단계의 여러 단계에서 딥 서포비전을 적용하며, 개별 손실 함수를 통해 중간 예측을 안내하고 훈련 안정성을 향상시킨다.
  • 적대적 훈련 구성 요소를 도입하여, 판별자 네트워크가 진짜 간장 마스크와 생성자(DI2IN)의 예측 간을 구분하도록 훈련함으로써 더 선명하고 현실적인 분할 출력을 유도한다.
  • 생성자 손실는 표준 교차 엔트로피 손실와 적대적 손실 항목을 조합하여 구성되며, 판별자의 피드백을 통해 생성자의 출력 분포를 정교화한다.
  • 학습률 0.01로 확률적 경사 하강법를 사용하여 엔드 투 엔드로 훈련하며, 100 반복 후 학습률을 10배 감소시키고, 적대적 훈련은 균형 가중치 λ = 0.01로 수행한다.

실험 결과

연구 질문

  • RQ1적대적 훈련은 흐린 경계가 있는 영역에서 3D CT 볼륨의 간장 분할 품질을 향상시키는가?
  • RQ21,000개 이상의 다양한 3D CT 볼륨으로 구성된 대규모 데이터셋에서의 훈련은 딥 러닝 기반 간장 분할의 강건성과 정확도를 크게 향상시키는가?
  • RQ3스킵 연결과 딥 서포비전을 갖춘 엔드 투 엔드 이미지-이미지 네트워크는 CRF나 그래프 컷과 같은 후처리 보정 기법에 의존하지 않고 기존 방법을 능가하는가?
  • RQ4제안된 DI2IN-AN 프레임워크는 검증되지 않은 임상 데이터에서 최신 기술 수준의 방법들과 성능과 추론 속도 면에서 어떻게 비교되는가?
  • RQ5기존 보정 기법에 비해 적대적 훈련은 저대비 간장 영역에서 경계 누출을 얼마나 줄이는가?

주요 결과

  • 제안된 DI2IN-AN은 독립 테스트 세트 50건에서 평균 대칭 표면 거리(ASD) 1.90 mm와 덱스 계수 0.95를 달성하여 모든 베이스라인 방법을 능가했다.
  • 1,000개 이상의 CT 볼륨으로 훈련하면 400개 볼륨으로 훈련한 경우에 비해 평균 ASD가 0.23 mm 감소하고 최대 ASD는 3.84 mm 감소했다.
  • 적대적 구성 요소는 400개 볼륨으로 훈련한 경우 최대 ASD 오차 7.82 mm에서 1,000개 볼륨으로 훈련한 경우 6.32 mm로 감소시켜 경계 정확도 향상을 확인했다.
  • NVIDIA TITAN X GPU에서 3D 볼륨당 추론 시간이 1초 미만으로 기록되어, 이전 방법들(예: [6]에서 보고된 1.5분)보다 훨씬 빠르게 작동했다.
  • CRF와 그래프 컷 후처리 방법은 저대비 데이터에서 분할 성능을 악화시켰으며, 이는 흐린 경계를 다루는 데 있어 엔드 투 엔드 적대적 학습의 우수성을 확인한다.
  • 1,000개 이상의 케이스로 훈련한 DI2IN-AN 모델은 기존 네트워크 대비 평균 대칭 표면 거리에서 20% 향상된 성능을 기록하여 대규모 데이터의 이점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.