Skip to main content
QUICK REVIEW

[논문 리뷰] Performance assessment of the deep learning technologies in grading glaucoma severity

Zhen Yi, Lei Wang|arXiv (Cornell University)|2018. 10. 31.
Retinal Imaging and Analysis인용 수 11
한 줄 요약

이 연구는 색채 안저 영상에서 녹내장 중증도를 평가하기 위해 여덟 가지 딥러닝 모델을 평가하며, 전반적인 영역과 국소적 영역에 대한 성능을 비교한다. 특히 피드포워드가 적용된 모델, 특히 DenseNet은 전반적인 영역에 대해 최대 85.29%의 2차 가중 카파를 기록하여, 전체 영역의 안저 영상가 국소적 시신경두부 영역보다 더 풍부한 진단 정보를 담고 있음을 보여준다.

ABSTRACT

Objective: To validate and compare the performance of eight available deep learning architectures in grading the severity of glaucoma based on color fundus images. Materials and Methods: We retrospectively collected a dataset of 5978 fundus images and their glaucoma severities were annotated by the consensus of two experienced ophthalmologists. We preprocessed the images to generate global and local regions of interest (ROIs), namely the global field-of-view images and the local disc region images. We then divided the generated images into three independent sub-groups for training, validation, and testing purposes. With the datasets, eight convolutional neural networks (CNNs) (i.e., VGG16, VGG19, ResNet, DenseNet, InceptionV3, InceptionResNet, Xception, and NASNetMobile) were trained separately to grade glaucoma severity, and validated quantitatively using the area under the receiver operating characteristic (ROC) curve and the quadratic kappa score. Results: The CNNs, except VGG16 and VGG19, achieved average kappa scores of 80.36% and 78.22% when trained from scratch on global and local ROIs, and 85.29% and 82.72% when fine-tuned using the pre-trained weights, respectively. VGG16 and VGG19 achieved reasonable accuracy when trained from scratch, but they failed when using pre-trained weights for global and local ROIs. Among these CNNs, the DenseNet had the highest classification accuracy (i.e., 75.50%) based on pre-trained weights when using global ROIs, as compared to 65.50% when using local ROIs. Conclusion: The experiments demonstrated the feasibility of the deep learning technology in grading glaucoma severity. In particular, global field-of-view images contain relatively richer information that may be critical for glaucoma assessment, suggesting that we should use the entire field-of-view of a fundus image for training a deep learning network.

연구 동기 및 목표

  • 색채 안저 영상에서 녹내장 중증도를 평가하기 위한 여덟 가지 딥러닝 아키텍처의 성능을 평가하고 비교하는 것.
  • 전반적인 시야 영역의 영상과 국소적 시신경두부 영역의 영상 중 어느 것이 더 높은 진단 성능을 보이는지 평가하는 것.
  • 학습을 처음부터 시작하는 것과 사전 훈련된 가중치를 사용한 피드포워드 훈련 방식이 모델 정확도에 미치는 영향을 규명하는 것.
  • 녹내장 중증도 분류에 가장 효과적인 딥러닝 아키텍처를 특정하는 것.
  • 임상적 안저 영상만으로도 딥러닝이 녹내장 중증도를 신뢰성 있게 평가할 수 있음을 검증하는 것.

제안 방법

  • 두 명의 전문 안과의사가 녹내장 중증도를 주석 처리한 5,978장의 안저 영상의 회상적 수집.
  • 전반적인 시야 영역과 국소적 시신경두부 영역의 관심 영역(ROI) 패치를 추출하기 위한 영상 전처리.
  • 각 ROI 유형에 대해 독립적인 훈련, 검증, 테스트 세트로 데이터셋 분할.
  • 전체 영역과 국소 영역의 ROI에 대해 여덟 가지 사전 훈련된 및 무작위 초기화된 CNN(VGG16, VGG19, ResNet, DenseNet, InceptionV3, InceptionResNet, Xception, NASNetMobile)을 훈련.
  • ROC 곡선 아래 면적과 2차 가중 카파 점수를 사용하여 모델 성능 평가 및 평가자 간 일치도 분석.
  • 아키텍처 간 및 훈련 전략(처음부터 훈련 vs. 피드포워드) 간 성능 비교.

실험 결과

연구 질문

  • RQ1어느 딥러닝 아키텍처가 안저 영상에서 녹내장 중증도를 분류하는 데 가장 우수한 성능을 보이는가?
  • RQ2전반적인 시야 영역의 영상 사용이 국소적 시신경두부 영역보다 더 높은 분류 성능을 제공하는가?
  • RQ3사전 훈련된 가중치를 사용한 피드포워드 훈련이 처음부터 훈련하는 것보다 모델 성능에 어떤 영향을 미치는가?
  • RQ4VGG 기반 모델은 사전 훈련된 가중치를 사용할 경우 일관된 성능을 유지하는가, 아니면 특정 설정에서 실패하는가?
  • RQ5전반적인 영역과 국소 영역의 ROI에 적용했을 때 모델 간 성능 차이가 유의미한가?

주요 결과

  • DenseNet은 전반적인 ROIs에서 사전 훈련된 가중치를 사용했을 때 75.50%의 최고 분류 정확도를 기록했으며, 국소 ROIs에서는 65.50%였다.
  • 피드포워드가 적용된 모델은 처음부터 훈련한 모델보다 평균 카파 점수를 더 높게 기록했으며, 전반적인 ROIs에서는 85.29%, 국소 ROIs에서는 82.72%였고, 처음부터 훈련한 모델은 각각 80.36%와 78.22%였다.
  • VGG16과 VGG19는 처음부터 훈련했을 땐 합리적인 성능을 보였지만, 전반적인 ROIs와 국소 ROIs 모두에서 사전 훈련된 가중치를 사용했을 경우 실패했다.
  • 전반적인 시야 영역의 영상가 모든 모델에서 일관되게 높은 성능을 보였으며, 이는 녹내장 중증도 평가에 더 풍부한 진단 정보를 제공함을 시사한다.
  • 가장 뛰어난 성능을 보인 모델(DenseNet + 전반적 ROIs에서의 피드포워드 훈련)은 2차 가중 카파 점수 85.29%를 기록했다.
  • 이 연구는 표준 안저 영상만으로도 딥러닝을 활용한 자동 녹내장 중증도 평가가 가능하다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.