Skip to main content
QUICK REVIEW

[논문 리뷰] Classification of Diabetic Retinopathy using Pre-Trained Deep Learning Models

Inas Mudheher Raghib Kafı Al-Kamachy, Hassanpour, Reza|arXiv (Cornell University)|2024. 03. 29.
Retinal Imaging and AnalysisMedicine인용 수 3
한 줄 요약

이 연구는 다유산성 망막병변을 다섯 단계(Normal에서 증식성 DR까지)로 분류하기 위한 사전 훈련된 딥 러닝 모델—VGG-16, MobileNet, InceptionV3, InceptionResNetV2—을 사용한 컴퓨터 지원 진단 시스템을 제안한다. 케글 데이터셋의 1,000장의 망막도 안에서 데이터 증강과 전이 학습을 적용한 결과, InceptionResNetV2가 0.69의 최고 AUC를 기록하여 깊이와 아키텍처의 효율성 덕분에 다른 모델들을 능가했다.

ABSTRACT

Diabetic Retinopathy (DR) stands as the leading cause of blindness globally, particularly affecting individuals between the ages of 20 and 70. This paper presents a Computer-Aided Diagnosis (CAD) system designed for the automatic classification of retinal images into five distinct classes: Normal, Mild, Moderate, Severe, and Proliferative Diabetic Retinopathy (PDR). The proposed system leverages Convolutional Neural Networks (CNNs) employing pre-trained deep learning models. Through the application of fine-tuning techniques, our model is trained on fundus images of diabetic retinopathy with resolutions of 350x350x3 and 224x224x3. Experimental results obtained on the Kaggle platform, utilizing resources comprising 4 CPUs, 17 GB RAM, and 1 GB Disk, demonstrate the efficacy of our approach. The achieved Area Under the Curve (AUC) values for CNN, MobileNet, VGG-16, InceptionV3, and InceptionResNetV2 models are 0.50, 0.70, 0.53, 0.63, and 0.69, respectively.

연구 동기 및 목표

  • 딥 러닝을 활용한 자동화되고 정확하며 확장 가능한 다유산성 망막병변(CAD) 시스템을 개발하기 위해.
  • VGG-16, MobileNet, InceptionV3, InceptionResNetV2 등의 사전 훈련된 컨volutional 네트워크 아키텍처가 다중 클래스 DR 분류에서 어떻게 성능을 내는지 평가하기 위해.
  • 제한된 망막도 데이터셋에서 사전 훈련된 모델의 미세 조정과 데이터 증강을 통해 분류 정확도를 향상시키기 위해.
  • 의료 망막 영상에서 미세한 DR 중증도 수준을 탐지하기 위해 가장 효과적인 딥 러닝 아키텍처를 식별하기 위해.
  • 가벼운 모델인 MobileNet을 활용한 향후 이식 가능한 모바일 진단 도구 개발을 위해 다유산성 망막병변 조기 진단을 가능하게 하기 위해.

제안 방법

  • 케글의 1,000장의 망막도 데이터셋에서 사전 훈련된 딥 러닝 모델(VGG-16, MobileNet, InceptionV3, InceptionResNetV2)을 전이 학습을 통해 미세 조정하였다.
  • 훈련 데이터의 다양성을 높이고 과적합을 줄이기 위해 이미지 증강 기법을 적용하여 데이터셋을 2,000장으로 확장하였다.
  • 모델 입력 요구 사양을 충족시키고 중요한 망막 특징을 유지하기 위해 이미지를 350x350x3 및 224x224x3 해상도로 크기 조정하였다.
  • 수렴을 향상시키고 과적합을 방지하기 위해 조기 정지 기법을 적용한 Adam 옵timizer를 사용하였다.
  • 두 단계 분류 헤드를 구현: 1x1 컨볼루션 레이어 후에 드롭아웃(0.5)을 적용한 두 개의 밀집 블록을 연결하여 정규화를 수행하였다.
  • 하위 레이어를 동결하고 상위 레이어만 미세 조정하여 사전 훈련된 특징을 의료 영상 도메인에 적응시켰다.
Figure 1: Diabetic Retinopathy Stages
Figure 1: Diabetic Retinopathy Stages

실험 결과

연구 질문

  • RQ1제한된 망막도 데이터셋에서 다중 클래스 다유산성 망막병변 분류에 가장 우수한 성능을 보이는 사전 훈련된 딥 러닝 모델은 무엇인가?
  • RQ2데이터 증강은 전이 학습 모델의 일반화 능력과 AUC 성능에 어떤 영향을 미치는가?
  • RQ3모델의 깊이와 아키텍처(예: Inception 대비 VGG)는 의료 영상 분류 작업에서 AUC와 정확도에 어떤 영향을 미치는가?
  • RQ4MobileNet과 같은 경량 모델의 미세 조정된 성능가 InceptionResNetV2와 같은 깊은 모델에 비해 경쟁적인가?
  • RQ5다른 이미지 해상도(224x224 대비 350x350)는 모델 성능과 훈련 효율성에 어떤 영향을 미치는가?

주요 결과

  • InceptionResNetV2가 가장 높은 AUC 0.69를 기록하여 VGG-16(0.53), InceptionV3(0.63), MobileNet(0.70), 커스텀 CNN(0.50)을 모두 앞섰다.
  • MobileNet은 AUC 0.70을 기록하여 두 번째로 높은 성능을 보였으며, 파라미터 수가 적은데도 깊이 있는 분리 컨볼루션과 효율적인 아키텍처 덕분이었다.
  • InceptionV3는 43 에포크 후 조기 정지를 적용한 결과 AUC 0.63을 기록하여 이전 연구에서 같은 모델을 사용한 결과보다 향상된 성능을 보였다.
  • VGG-16는 85개의 에포크를 거치며 성능이 좋지 않았다(AUC 0.53), 이는 23층의 얕은 깊이와 미세한 특징 학습 능력이 제한되어 있기 때문일 것이다.
  • 완전히 새로 구축한 커스텀 CNN은 AUC 0.50을 기록하여 깊이가 부족하고 훈련 데이터가 부족하여 성능이 열악했다.
  • 이미지 증강과 미세 조정이 모델의 일반화 능력을 크게 향상시켰으며, 최종 훈련 세트는 증강 기법을 통해 1,620장으로 확장되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.