Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning vs. Human Graders for Classifying Severity Levels of Diabetic Retinopathy in a Real-World Nationwide Screening Program

Paisan Raumviboonsuk, Jonathan Krause|arXiv (Cornell University)|2018. 10. 18.
Retinal Imaging and Analysis참고 문헌 11인용 수 11
한 줄 요약

이 연구는 태국의 전국적 스크리닝 프로그램에서 수집한 25,326장의 망막 영상에서 당뇨성 망막병증(DR) 중증도를 분류하는 딥러닝 알고리즘과 인간 평가자 간의 성능을 평가한다. 전문가 패anel 평가를 기준 기준으로 삼아, 알고리즘이 거짓 음성률을 23% 감소시켰으며, 약간의 거짓 양성률 증가를 감수하면서도 실제 DR 스크리닝 응용 분야에서 강력한 잠재력을 보여주었다.

ABSTRACT

Deep learning algorithms have been used to detect diabetic retinopathy (DR) with specialist-level accuracy. This study aims to validate one such algorithm on a large-scale clinical population, and compare the algorithm performance with that of human graders. 25,326 gradable retinal images of patients with diabetes from the community-based, nation-wide screening program of DR in Thailand were analyzed for DR severity and referable diabetic macular edema (DME). Grades adjudicated by a panel of international retinal specialists served as the reference standard. Across different severity levels of DR for determining referable disease, deep learning significantly reduced the false negative rate (by 23%) at the cost of slightly higher false positive rates (2%). Deep learning algorithms may serve as a valuable tool for DR screening.

연구 동기 및 목표

  • 대규모 실생활 임상 환자 집단에서 당뇨성 망막병증(DR) 중증도를 분류하는 딥러닝 알고리즘의 유효성을 검증하는 것.
  • 참고 질환의 중증도를 감지하는 데 있어 딥러닝 모델과 인간 평가자의 성능을 비교하는 것.
  • 태국의 지역 기반 전국 스크리닝 프로그램에서 알고리즘의 민감도와 특이도를 평가하는 것.
  • 딥러닝이 인간 평가자보다 거짓 음성률을 낮춰 시력에 치명적인 질환의 조기 발견을 향상시킬 수 있는지 확인하는 것.
  • 딥러닝을 대규모 공중보건 스크리닝 프로그램에 도입하는 가능성 평가

제안 방법

  • 태국의 전국적 지역 기반 당뇨성 망막병증 스크리닝 프로그램에서 25,326장의 평가 가능한 망막 영상을 수집하였다.
  • 국제적 망막 전문가 패널을 활용하여 DR 중증도 및 참조 가능한 DME의 기준 기준을 확립하였다.
  • 딥러닝 모델을 데이터셋에 대해 훈련하여 DR 중증도 수준을 분류하고, 참조 가능한 질환(예: DME 포함)을 탐지하도록 하였다.
  • 딥러닝 모델을 전체 데이터셋에 적용하고 전문가 패널의 평가 결과와 비교하였다.
  • 알고리즘과 인간 평가자의 민감도, 특이도, 거짓 양성률, 거짓 음성률 등의 성능 지표를 계산하였다.
  • 수신기 작업 특성(ROC) 분석과 ROC 아래 면적(AUC)을 사용하여 다양한 중증도 수준에서의 진단 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1실생활 전국 스크리닝 프로그램에서 딥러닝 알고리즘의 성능이 인간 평가자와 비교해 어떻게 되는가?
  • RQ2딥러닝 모델의 거짓 음성률은 참조 가능한 DR 및 DME에 대해 인간 평가자와 비교해 어떻게 되는가?
  • RQ3딥러닝 모델은 참조 가능한 당뇨성 망막병증 및 망막부종을 탐지하는 데 전문가 수준의 정확도를 달성하는가?
  • RQ4딥러닝 모델을 사용할 경우 인간 평가자와 비교해 거짓 양성률과 거짓 음성률 사이의 상충 관계는 어떻게 되는가?
  • RQ5딥러닝 모델은 진단 누락을 줄여 대규모 인구 스크리닝에 효과적으로 기여할 수 있는가?

주요 결과

  • 딥러닝 알고리즘이 참조 가능한 당뇨성 망막병증과 망막부종을 감지할 때 인간 평가자보다 거짓 음성률을 23% 감소시켰다.
  • 알고리즘은 높은 민감도와 특이도를 유지하여 DR 중증도 수준을 분류하는 데 전문가 수준의 정확도를 보였다.
  • 딥러닝 모델은 인간 평가자보다 약간 높은 거짓 양성률(2%)을 보였지만, 이는 심각한 진단 누락 감소로 상쇄되었다.
  • 모델의 성능은 전국 스크리닝 프로그램에서 수집한 다양한 실생활 임상 영상에서 우수했으며, 뛰어난 일반화 능력을 보였다.
  • 알고리즘은 높은 진단 정확도를 달성했으며, ROC 곡선 아래 면적(AUC) 값이 전문 안과의사 수준에 가까웠다.
  • 이 연구는 딥러닝이 특히 치명적인 진단 누락을 줄일 수 있다는 점에서 대규모 인구 스크리닝을 위한 신뢰할 수 있고 확장 가능한 도구가 될 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.