Skip to main content
QUICK REVIEW

[논문 리뷰] Robust deep learning for eye fundus images: Bridging real and synthetic data for enhancing generalization

Guilherme Oliveira, Gustavo Henrique de Rosa|arXiv (Cornell University)|2022. 03. 25.
Retinal Imaging and Analysis인용 수 6
한 줄 요약

이 논문은 연령 관련 황반변성(AMD) 검출을 위한 딥러닝 모델 향상을 위해, 무료이자 특허가 없는 방식으로 스타일 제너레이티브 어드버서리 네트워크2-ADA(StyleGAN2-ADA)를 사용하여 고품질의 합성 망막도 이미지를 생성하는 방법을 제안한다. 이는 합성 이미지가 임상의들에게 실제 이미지와 구분되지 않으며, 실재 데이터와 증강된 데이터를 사용해 훈련된 ResNet-18 분류기의 정확도가 85%에 도달해 전문 임상의들의 평균 정확도(77.5%)를 초월함을 보여준다.

ABSTRACT

Deep learning applications for assessing medical images are limited because the datasets are often small and imbalanced. The use of synthetic data has been proposed in the literature, but neither a robust comparison of the different methods nor generalizability has been reported. Our approach integrates a retinal image quality assessment model and StyleGAN2 architecture to enhance Age-related Macular Degeneration (AMD) detection capabilities and improve generalizability. This work compares ten different Generative Adversarial Network (GAN) architectures to generate synthetic eye-fundus images with and without AMD. We combined subsets of three public databases (iChallenge-AMD, ODIR-2019, and RIADD) to form a single training and test set. We employed the STARE dataset for external validation, ensuring a comprehensive assessment of the proposed approach. The results show that StyleGAN2 reached the lowest Frechet Inception Distance (166.17), and clinicians could not accurately differentiate between real and synthetic images. ResNet-18 architecture obtained the best performance with 85% accuracy and outperformed the two human experts (80% and 75%) in detecting AMD fundus images. The accuracy rates were 82.8% for the test set and 81.3% for the STARE dataset, demonstrating the model's generalizability. The proposed methodology for synthetic medical image generation has been validated for robustness and accuracy, with free access to its code for further research and development in this field.

연구 동기 및 목표

  • AMD를 위한 레이블이 부여된 망막도 이미지 데이터셋의 부족성과 불균형 문제를 해결하여 딥러닝 모델 훈련을 제한하는 데 기여한다.
  • 특허된 GAN 기반 방법의 대안으로 무료이며 접근 가능한 합성 의료 영상 생성 방법을 개발한다.
  • 다양한 GAN 아키텍처를 통해 합성 망막도 이미지의 품질과 임상적 현실성에 대해 평가한다.
  • 합성 데이터를 사용한 증강이 딥러닝 성능을 인간 전문가의 정확도를 초월하여 AMD 분류에 기여하는지 평가한다.
  • 연구를 가속화하기 위해 오픈소스 도구와 사전 훈련된 모델을 제공한다.

제안 방법

  • iChallenge-AMD, ODIR-2019, RIADD의 세 개의 공개 데이터셋에서 확보한 실재 망막도 이미지를 기반으로 DCGAN, LSGAN, WGAN, WGAN-GP, DRAGAN, EBGAN, BEGAN, CGAN, ACGAN, StyleGAN2-ADA를 포함한 10종의 다양한 GAN 아키텍처를 훈련시켰다.
  • 이미지 품질 향상과 모드 붕괴 방지에서 뛰어난 성능을 보인 점을 고려해, 데이터 생성에 스타일 제너레이티브 어드버서리 네트워크2-ADA(StyleGAN2-ADA)를 사용하였다.
  • 합성 이미지의 품질 평가를 위해 Fréchet Inception Distance(FID)를 사용하였으며, 낮은 점수일수록 더 현실적인 이미지를 의미한다.
  • 실재 이미지와 합성 이미지의 구별 가능성을 평가하기 위해 두 명의 전문 안과의사가 임상 평가를 수행하였다.
  • 실재 및 합성 이미지로 구성된 혼합 데이터셋을 사용해 ResNet-18 분류기를 훈련시켜 AMD 검출 성능을 평가하였다.
  • 모델의 주의 집중 영역을 해석하고 임상적 해석 가능성을 높이기 위해 Grad-CAM 히트맵을 적용하였다.

실험 결과

연구 질문

  • RQ1FID 및 임상적 인식 기준으로 측정했을 때, 어떤 GAN 아키텍처가 AMD 검출을 위한 가장 높은 품질의 합성 망막도 이미지를 생성하는가?
  • RQ2임상 전문가들이 GAN으로 생성된 합성 망막도 이미지를 실재 이미지와 신뢰성 있게 구별할 수 있는가?
  • RQ3합성 이미지를 사용한 데이터 증강이 AMD와 비AMD 망막도 이미지 분류에 있어 딥러닝 모델의 성능을 향상시키는가?
  • RQ4실재 및 합성 데이터를 기반으로 훈련된 딥러닝 모델이 인간 전문가의 AMD 검출 정확도를 초월할 수 있는가?
  • RQ5다양한 망막도 이미지 분포 및 품질 수준에 대해, 다양한 GAN 아키텍처가 얼마나 잘 일반화되는가?

주요 결과

  • StyleGAN2-ADA는 모든 평가된 GAN 중에서 가장 낮은 Fréchet Inception Distance(FID) 166.17을 기록하여, 실재 망막도 이미지와 가장 높은 인지적 유사도를 보였다.
  • 임상 전문가들은 실재 이미지와 합성 이미지를 신뢰성 있게 구분하지 못했으며, 분류 정확도는 약 50%에 머물러 있어 매우 높은 현실성과 임상적 타당성을 입증했다.
  • 실재 및 합성 이미지를 혼합한 데이터셋으로 훈련된 ResNet-18 분류기는 AMD 검출에서 85%의 정확도를 기록했으며, 평균 전문가 정확도(77.5%)를 뛰어넘었다.
  • StyleGAN2-ADA가 생성한 합성 이미지들은 드루센과 같은 핵심 병리적 특징을 유지하여 임상적 관련성이 높았다.
  • 최근 특허된 GAN 기반 접근 방식과 유사한 성능를 달성했지만, 전체적으로 공개 접근이 가능하고 오픈소스 구현이 가능했다.
  • 사전 훈련된 모델과 코드를 포함한 전체 파ip라인은 https://github.com/GuiCamargoX/amd-synthetic 에 공개되어 있어 재현성 및 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.