[논문 리뷰] Fully Convolutional Neural Network for Semantic Segmentation of Anatomical Structure and Pathologies in Colour Fundus Images Associated with Diabetic Retinopathy
이 논문은 색채 안구도에서 망막 구조물과 당뇨성 망막병변의 엔드 투 엔드 의미적 세그멘테이션을 위한 인코더-디코더 아키텍처를 기반으로 한 완전 컨volution 신경망을 제안한다. 이는 VGG16과 SegNet에서 영감을 받았다. 모델은 망막 신경초점 세그멘테이션에 Jaccard 지수 0.8572를 기록했으며, 병변 탐지 성능을 향상시키기 위해 망막 신경초점을 별도의 클래스로 포함시켜 민감도-PPV 트레이드오프 분 析를 통해 최적화된 임계값을 선택하였다.
Diabetic retinopathy (DR) is the most common form of diabetic eye disease. Retinopathy can affect all diabetic patients and becomes particularly dangerous, increasing the risk of blindness, if it is left untreated. The success rate of its curability solemnly depends on diagnosis at an early stage. The development of automated computer aided disease diagnosis tools could help in faster detection of symptoms with a wider reach and reasonable cost. This paper proposes a method for the automated segmentation of retinal lesions and optic disk in fundus images using a deep fully convolutional neural network for semantic segmentation. This trainable segmentation pipeline consists of an encoder network, a corresponding decoder network followed by pixel-wise classification to segment microaneurysms, hemorrhages, hard exudates, soft exudates, optic disk from background. The network was trained using Binary cross entropy criterion with Sigmoid as the last layer, while during an additional SoftMax layer was used for boosting response of single class. The performance of the proposed method is evaluated using sensitivity, positive prediction value (PPV) and accuracy as the metrices. Further, the position of the Optic disk is localised using the segmented output map.
연구 동기 및 목표
- 색채 안구도에서 당뇨성 망막병변과 관련된 해부학적 구조물과 병변에 대한 의미적 픽셀 단위 세그멘테이션을 위한 엔드 투 엔드 학습 가능한 딥 러닝 프레임워크를 개발하는 것.
- 미세동맥류, 출혈, 딱딱한 및 연한 출현물, 망막 신경초점을 정확하게 세그멘테이션하여 당뇨성 망막병변의 조기 탐지 능력을 향상시키는 것.
- 망막 신경초점과 딱딱한 출현물 간의 구분 어려움을 해결하기 위해 세그멘테이션 작업에 망막 신경초점을 별도의 클래스로 포함시키는 것.
- 세그멘테이션 출력에서 중심점 탐지 방법을 통해 망막 신경초점을 국소화하여 질병 평가에 대한 해부학적 기준을 제공하는 것.
- 수동적인 특징 공학을 제거하고 DR 스크리닝에서의 다중 하위작업을 위한 통합 솔루션을 제공하는 것.
제안 방법
- 방법론은 VGG16의 첫 13개 레이어와 동일한 구조를 가진 인코더에 13개의 컨볼루션 레이어를 포함하고, 이에 대응하는 디코더 네트워크를 갖춘 인코더-디코더 아키텍처를 사용한다.
- 각 인코더 블록은 컨볼루션, 배치 정규화, ReLU 활성화 함수, 스트라이드 2인 2×2 최대 풀링을 적용하여 특징 맵을 다운샘플링한다.
- 학습된 역컨볼루션 레이어와 스킵 커넥션을 사용하여 특징 맵을 원본 입력 해상도로 업샘플링함으로써 공간적 세부 정보를 유지한다.
- 최종 레이어는 각 클래스에 대해 이진 분류를 위한 시그모이드 활성화 함수를 사용하고, 추론 시에는 클래스 확률을 채널 간 정규화하기 위해 소프트맥스 레이어를 사용한다.
- 모델는 Adam 옵티마이저(초기 학습률 10⁻³, β₁ = 0.9)를 사용한 이진 교차 엔트로피 손실 함수로 훈련되며, 검증 손실 기반 조기 정지 기법이 적용된다.
- 과적합을 완화하고 일반화 능력을 향상시키기 위해 각 클래스별로 다양한 에포크에서 성능이 가장 좋았던 모델을 앙상블하여 사용한다.
실험 결과
연구 질문
- RQ1완전 컨볼루션 신경망이 색채 안구도에서 여러 망막 병변과 해부학적 구조물의 공동 의미적 세그멘테이션을 효과적으로 수행할 수 있는가?
- RQ2비슷한 밝기 수준을 가진 딱딱한 출현물과의 혼동을 방지하기 위해 망막 신경초점을 별도의 클래스로 포함시키면 모델의 구분 능력이 향상되는가?
- RQ3전역적 맥락을 활용한 인코더-디코더 아키텍처와 패치 기반 훈련 방식 간의 병변 세그멘테이션 정확도를 비교했을 때 어떤 것이 더 우수한가?
- RQ4각 병변 유형에 대해 민감도와 양성 예측도(PPV) 간 트레이드오프를 최적화하는 임계값은 무엇인가?
- RQ5훈련 시 진정한 위치 정보를 사용하지 않고도 세그멘테이션 출력을 통해 망막 신경초점을 얼마나 정확하게 국소화할 수 있는가?
주요 결과
- 망막 신경초점 세그멘테이션에 대해 Jaccard 지수(IoU) 0.8572를 기록하여 진정한 값과의 겹침이 매우 높음을 나타냈다.
- 민감도 대 PPV 곡선 아래 면적은 미세동맥류 0.0059, 딱딱한 출현물 0.5498, 출혈 0.0829, 연한 출현물 0.1823로, 병변 유형 간 탐지 성능의 다양성을 반영했다.
- 413장의 테스트 이미지에서 예측된 망막 신경초점 중심점과 진정한 중심점 간 평균 유클리드 거리는 65.93 픽셀이었으며, 합리적인 국소화 정확도를 보였다.
- 망막 신경초점을 별도의 클래스로 포함시킴으로써 5개 클래스 설정 대비 세그멘테이션 성능이 크게 향상되었으며, 특히 출현물과 망막 신경초점 간 혼동을 줄이는 데 기여했다.
- 추론 시 소프트맥스 레이어를 사용함으로써 마스크 품질이 향상되어 예측 출력이 진정한 값에 더 가까워졌다.
- 패치 기반 훈련에 비해 모델가 전역 맥락을 갖춘 인코더-디코더 아키텍처를 사용함으로써 망막 신경초점과 출현물을 명확히 구분할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.