Skip to main content
QUICK REVIEW

[논문 리뷰] Normalization in Training U-Net for 2D Biomedical Semantic Segmentation

Xiao-Yun Zhou, Guang‐Zhong Yang|arXiv (Cornell University)|2018. 09. 11.
Advanced Neural Network Applications참고 문헌 22인용 수 4
한 줄 요약

이 논문은 2D 생체의학 영상 분할을 위한 U-Net 훈련에서 배치 정규화(BN), 인스턴스 정규화(IN), 레이어 정규화(LN), 그룹 정규화(GN)의 네 가지 정규화 기법을 평가한다. 내부 공변량 이동을 더 잘 다루기 때문에, 특히 소규모 배치 또는 환자별 데이터에서 BN보다 GN을 큰 그룹 수로 사용하거나 IN을 사용할 경우 모델의 일반화 능력과 분할 정확도가 더 효과적으로 향상됨을 발견하였다.

ABSTRACT

2D biomedical semantic segmentation is important for robotic vision in surgery. Segmentation methods based on Deep Convolutional Neural Network (DCNN) can out-perform conventional methods in terms of both accuracy and levels of automation. One common issue in training a DCNN for biomedical semantic segmentation is the internal covariate shift where the training of convolutional kernels is encumbered by the distribution change of input features, hence both the training speed and performance are decreased. Batch Normalization (BN) is the first proposed method for addressing internal covariate shift and is widely used. Instance Normalization (IN) and Layer Normalization (LN) have also been proposed. Group Normalization (GN) is proposed more recently and has not yet been applied to 2D biomedical semantic segmentation, however, no specific validations on GN were given. Most DCNNs for biomedical semantic segmentation adopt BN as the normalization method by default, without reviewing its performance. In this paper, four normalization methods - BN, IN, LN and GN are compared in details, specifically for 2D biomedical semantic segmentation. U-Net is adopted as the basic DCNN structure. Three datasets regarding the Right Ventricle (RV), aorta, and Left Ventricle (LV) are used for the validation. The results show that detailed subdivision of the feature map, i.e. GN with a large group number or IN, achieves higher accuracy. This accuracy improvement mainly comes from better model generalization. Codes are uploaded and maintained at Xiao-Yun Zhou's Github.

연구 동기 및 목표

  • 다양한 정규화 기법이 2D 생체의학 영상 분할을 위한 U-Net 훈련에 미치는 영향을 조사하기 위해.
  • 특히 훈련 중 특징 분포의 이동으로 인한 내부 공변량 이동 문제를 해결하기 위해.
  • 보편적으로 사용되는 배치 정규화(BN)보다 GN, IN, LN와 같은 대체 정규화 방법이 분할 정확도 및 일반화 능력 측면에서 뛰어나지 않는지 평가하기 위해.
  • 다양한 해부학적 구조(RV, 대동맥, LV)와 다양한 강도 분포를 가진 환자별 데이터에서 정규화 기법의 효과를 검증하기 위해.
  • 미래의 생체의학 영상 딥러닝에서 정규화 레이어 설계를 위한 최적의 전략을 도출하기 위해 일반화 및 강인성 측면에서 최적의 전략을 규명하기 위해.

제안 방법

  • U-Net에 배치 정규화(BN), 인스턴스 정규화(IN), 레이어 정규화(LN), 다양한 그룹 수(GN4, GN8, GN16)를 가진 그룹 정규화(GN)를 적용하여 훈련하였다.
  • U-Net 인코더 및 디코더의 각 컨볼루션 레이어 뒤에 정규화를 적용하여 특징 분포를 안정화하고 내부 공변량 이동을 감소시켰다.
  • 오른쪽 심실(RV), 대동맥, 왼쪽 심실(LV) 분할을 위한 세 가지 공개된 2D 심장 MRI/CT 데이터셋을 사용하여 다양한 해부학적 구조에서의 성능을 평가하였다.
  • 주요 평가 지표로 DSC(Dice Similarity Coefficient)를 사용하였으며, 안정성과 일반화 능력을 평가하기 위해 반복적인 훈련을 실시하였다.
  • BN의 경우 훈련 시 통계(TrainI)와 테스트 시 통계(TestI)를 사용한 추론 행동을 비교하여 분포 이동에 대한 강인성 평가를 수행하였다.
  • 배치 크기 영향과 다양한 무작위 시드를 통한 정규화 방법 성능 평가를 위한 분석 실험을 실시하여 훈련 안정성 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1U-Net를 사용한 2D 생체의학 영상 분할에서, 높은 그룹 수를 가진 그룹 정규화(GN) 또는 인스턴스 정규화(IN)가 배치 정규화(BN)를 초월하는가?
  • RQ2다양한 영상 강도 분포를 가진 환자별 데이터에서, 다양한 정규화 방법이 모델의 일반화 능력에 어떤 영향을 미치는가?
  • RQ3배치 크기가 U-Net 훈련에서 생체의학 영상 분할을 위한 정규화 기법 성능에 어떤 영향을 미치는가?
  • RQ4추론 시 훈련 시 통계(TrainI) 대신 테스트 시 통계(TestI)를 사용할 경우, BN의 성능이 향상되는가?
  • RQ5정규화 기법은 심층 U-Net 아키텍처를 생체 영상에서 처음부터 훈련할 때 내부 공변량 이동의 부정적 영향을 완화할 수 있는가?

주요 결과

  • 큰 그룹 수를 가진 그룹 정규화(GN, 예: GN16)는 대동맥 데이터셋에서 평균 DSC 0.8091을 기록하여 BN(0.8274)과 LN(0.8189)을 초월하였다.
  • 인스턴스 정규화(IN)는 RV 데이터셋에서 평균 DSC 0.7035를 기록하여 BN(0.6436)을 크게 능가하였으며, 낮은 대trast를 가지는 이 도전적인 해부학적 구조에서 최고의 성능을 보였다.
  • 특히 GN과 IN은 초기 정확도가 낮았던 환자들(예: RV의 환자 31, 대동맥의 환자 15)에서 분할 정확도 향상이 두드러져 일반화 능력 향상이 확인되었다.
  • 여섯 차례의 독립적인 훈련 실행 동안 표준편차는 LN가 가장 높았고(0.0562), GN8가 가장 낮았다(0.0097), 이는 중간 크기의 그룹 수를 가진 GN이 더 뛰어난 훈련 안정성을 제공함을 시사한다.
  • 소규모 배치 크기가 대규모 배치 크기보다 분할 정확도 측면에서 뛰어나, BN의 성능이 생체의학 영상에서 배치 크기에 민감함을 시사한다.
  • 추론 시 훈련 시 통계(TrainI) 대신 테스트 시 통계(TestI)를 사용할 경우 BN의 성능 향상이 관찰되어, BN의 통계가 배치 분포 이동에 민감함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.