Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Encoder Fusion U-Net (DEFU-Net) for Cross-manufacturer Chest X-ray Segmentation

Lipei Zhang, Aozhi Liu|arXiv (Cornell University)|2020. 09. 11.
COVID-19 diagnosis using AI참고 문헌 41인용 수 4
한 줄 요약

이 논문은 교차 제조사 흉부 X선 영상 분할을 위한 이중 경로 인코더 융합 U-Net 아키텍처인 DEFU-Net을 제안한다. 이는 인셉션 블록, 확장 컨볼루션, 그리고 밀집 연결 순환 컨볼루션 블록을 결합하여 공간적 및 맥락적 특징 추출을 향상시킨다. 모델은 몬고메리 및 셴젠 병원의 혼합 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하여, U-Net, Res-U-Net, BCDU-Net, R2U-Net 및 어텐션 강화 버전 대비 다양한 지표인 Dice, IOU, F1-score, AUC에서 모두 뛰어난 성능을 보였다.

ABSTRACT

A number of methods based on deep learning have been applied to medical image segmentation and have achieved state-of-the-art performance. Due to the importance of chest x-ray data in studying COVID-19, there is a demand for state-of-the-art models capable of precisely segmenting soft tissue on the chest x-rays. The dataset for exploring best segmentation model is from Montgomery and Shenzhen hospital which had opened in 2014. The most famous technique is U-Net which has been used to many medical datasets including the Chest X-rays. However, most variant U-Nets mainly focus on extraction of contextual information and skip connections. There is still a large space for improving extraction of spatial features. In this paper, we propose a dual encoder fusion U-Net framework for Chest X-rays based on Inception Convolutional Neural Network with dilation, Densely Connected Recurrent Convolutional Neural Network, which is named DEFU-Net. The densely connected recurrent path extends the network deeper for facilitating contextual feature extraction. In order to increase the width of network and enrich representation of features, the inception blocks with dilation are adopted. The inception blocks can capture globally and locally spatial information from various receptive fields. At the same time, the two paths are fused by summing features, thus preserving the contextual and spatial information for decoding part. This multi-learning-scale model is benefiting in Chest X-ray dataset from two different manufacturers (Montgomery and Shenzhen hospital). The DEFU-Net achieves the better performance than basic U-Net, residual U-Net, BCDU-Net, R2U-Net and attention R2U-Net. This model has proved the feasibility for mixed dataset and approaches state-of-the-art. The source code for this proposed framework is public https://github.com/uceclz0/DEFU-Net.

연구 동기 및 목표

  • 다양한 영상 제조사 간 도메인 이동과 이미지 품질의 변동성이 모델 일반화 능력에 영향을 주는 흉부 X선 영상에서 연조직을 분할하는 데 도전하는 것.
  • 의료 영상 분할에서 공간 인식과 맥락 이해를 동시에 향상시켜 특징 추출을 개선하는 것.
  • 몽고메리 및 셴젠 병원과 같은 다양한 출처에서 온 혼합 데이터셋을 처리할 수 있는 강건한 모델을 개발하는 것.
  • 특히 오차 분류가 쉬운 가장자리 및 소형 영역 픽셀에서의 분할 정확도를 향상시켜 기존 U-Net 변종을 능가하는 것.
  • 인코더 경로에서의 아키텍처 혁신을 통해 이질적인 데이터에 더 빠르게 수렴하고 더 나은 피팅을 가능하게 하는 것.

제안 방법

  • DEFU-Net은 이중 경로 인코더를 사용한다: 한 경로는 다양한 수용장( receptive field)을 가진 확장 컨볼루션을 갖춘 인셉션 블록을 사용하여 다중 척도 공간적 특징을 추출한다.
  • 두 번째 경로는 밀집 연결 순환 컨볼루션 블록(DCRC)을 구현하여 네트워크 깊이를 증가시키고 층 간 특징 전파를 향상시킨다.
  • 양 인코더 경로의 특징는 디코딩 이전에 요소별 덧셈을 통해 융합되며, 정확한 분할을 위해 풍부한 맥락적 및 공간적 정보를 유지한다.
  • 인코더와 디코더 경로 사이에 U-Net과 유사한 스킵 연결을 사용하여 공간 해상도와 기울기 흐름을 유지한다.
  • 버티브 레이어의 특징 맵 수는 네 번째 인코더 수준과 일치하도록 설정되어 있어 계산 비용을 절반으로 줄인다.
  • 모델은 조기 정지와 Adam 최적화를 사용한 교차 엔트로피 손실로 훈련되어 빠른 수렴과 높은 성능을 달성한다.

실험 결과

연구 질문

  • RQ1기존 U-Net 변종 대비 이중 경로 인코더 아키텍처가 교차 제조사 흉부 X선 영상 데이터셋에서 분할 성능을 향상시킬 수 있는가?
  • RQ2확장 인셉션 블록의 통합이 저대비, 가장자리 흐린 의료 영상에서 다중 척도 공간적 특징 추출을 향상시키는가?
  • RQ3밀집 연결 순환 블록이 인코더에서 특징 표현의 깊이와 맥락 모델링을 얼마나 향상시키는가?
  • RQ4이중 경로 특징의 합산을 통한 특징 융합이 장기 경계 근처에서 디코딩 정확도에 어떤 영향을 미치는가?
  • RQ5세부 조정 없이도 다양한 영상 제조사에서 온 데이터셋에 효과적으로 일반화할 수 있는가?

주요 결과

  • DEFU-Net은 테스트 세트에서 최고의 Dice 스코어 0.9667과 F1-score 0.9619를 기록하여 U-Net, Res-U-Net, BCDU-Net, Incep-Res-U-Net, R2U-Net 및 Att-R2U-Net을 모두 능가했다.
  • 교차 제조사 일반화 성능에서, 셴젠에서 훈련하고 몬고메리에서 테스트할 경우 Dice 스코어 0.9227을 기록했으며, 반대로 몬고메리에서 훈련하고 셴젠에서 테스트할 경우 0.9154를 기록하여 강력한 내성적 특성을 입증했다.
  • 기본 모델보다 빠른 수렴을 보였으며, 단 두 에포크 만에 정확도 0.9776에 도달했고, 145 에포크 동안 과적합 없이 훈련되었다.
  • 표준 3×3 컨볼루션 대비 확장 인셉션 블록의 사용이 전반적인 성능 향상에 크게 기여했으며, 특히 전역 및 국소 공간 패턴을 포착하는 데 유의미한 효과가 있었다.
  • 시각화 결과에서 DEFU-Net이 예측값을 진짜값과 더 잘 일치시키며, 특히 가장자리 영역과 소형 폐 부위에서 오진 양성 및 오진 음성 수를 줄이는 데 성공했다.
  • 확장 인셉션과 DCRC 블록의 조합이 제조사 간 도메인 이동과 영상 변동성에 대응하는 데 뛰어난 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.