[논문 리뷰] AIROGS: Artificial Intelligence for RObust Glaucoma Screening Challenge
AIROGS 챌린지는 대규모 다양 데이터셋에서 CFP를 이용한 녹내장 선별을 위한 강건한 AI 방법을 개발하며, 판독 불가 입력 탐지와 현실 세계에서의 강건성에 중점을 둡니다. 상위 팀들은 전문가 임상가와 유사한 성능을 달성했고 외부 데이터셋에 대한 강력한 일반화를 보여주었습니다.
The early detection of glaucoma is essential in preventing visual impairment. Artificial intelligence (AI) can be used to analyze color fundus photographs (CFPs) in a cost-effective manner, making glaucoma screening more accessible. While AI models for glaucoma screening from CFPs have shown promising results in laboratory settings, their performance decreases significantly in real-world scenarios due to the presence of out-of-distribution and low-quality images. To address this issue, we propose the Artificial Intelligence for Robust Glaucoma Screening (AIROGS) challenge. This challenge includes a large dataset of around 113,000 images from about 60,000 patients and 500 different screening centers, and encourages the development of algorithms that are robust to ungradable and unexpected input data. We evaluated solutions from 14 teams in this paper, and found that the best teams performed similarly to a set of 20 expert ophthalmologists and optometrists. The highest-scoring team achieved an area under the receiver operating characteristic curve of 0.99 (95% CI: 0.98-0.99) for detecting ungradable images on-the-fly. Additionally, many of the algorithms showed robust performance when tested on three other publicly available datasets. These results demonstrate the feasibility of robust AI-enabled glaucoma screening.
연구 동기 및 목표
- 현실 세계의 판독 불가 조건에서 CFP를 이용한 강건한 AI 기반 녹내장 선별의 가능성을 평가한다.
- 판독 불가하고 예측치 못한 입력에 대한 강건성을 높이는 대규모의 다양한 데이터셋과 챌린지 프레임워크를 만든다.
- 제출된 알고리즘을 선별 성능과 입력의 판독 불가 신뢰성에 대해 평가하고 외부 검증을 수행한다.
- AI 솔루션을 인간 전문가와 비교하고 컨테이너화된 제출물과 공개 데이터셋을 통한 재현성을 확립한다.
제안 방법
- 레이블 RG, NRG, 또는 Ungradable로 구성된 대규모 다양성의 훈련/테스트 데이터셋(약 60,071명의 피험자, 약 500개 사이트에서 112,732 CFP)을 제공한다.
- 재현성을 보장하고 비공개 테스트 데이터에 대한 클라우드 기반 평가를 가능하게 하기 위해 참가자들이 컨테이너화된 알고리즘(Type 2 챌리)제를 제출하도록 요구한다.
- 두 가지 선별 지표(pAUC_S: 높은 특이도에서 RG에 대한, SE@95SP_S)와 두 가지 강건성 지표(kappa_U: 인간과의 판독 불가 합의도, AUC_U: 판독 불가 점수 상관관계)로 솔루션을 평가한다.
- 학습된 알고리즘을 세 개의 공개 데이터셋(REFUGE, GAMMA, DRIMDB)에 적용하여 일반화와 강건성을 평가하는 외부 검증을 허용한다.
- 훈련 데이터에 판독 불가 데이터를 사용하지 않고도 실시간으로 판독 불가 이미지를 탐지하는 방법을 장려한다.
실험 결과
연구 질문
- RQ1현실 세계의 비선별되지 않은 테스트 세트에서 고특이도와 고민감도로 CFP에서 Referable glaucoma를 탐지할 수 있는가?
- RQ2AI 시스템이 분포 밖(out-of-distribution) 데이터가 존재하는 상황에서도 판독 불가 이미지를 신뢰성 있게 식별하고 강건한 불확실성 측정을 제공할 수 있는가?
- RQ3학습 도메인을 넘어 외부 녹내장 데이터셋에 AI 솔루션이 잘 일반화되는가?
- RQ4강건한 아키텍처와 입력 품질 인식을 사용하여 전문가 안과의사에 필적하는 성능을 달성하는 것이 가능한가?
주요 결과
- 최고 팀들은 녹내장 선별 과제에서 20명의 전문가 안과의사/검안사를 대상으로 한 성능과 유사한 성능을 달성했다.
- 최고의 방법은 즉시 판독 불가 이미지를 탐지하는 데 AUC 0.99(95% CI: 0.98–0.99)에 도달했다.
- 네 차례의 챌린지 단계에 걸쳐 30개 팀이 참여했고, 최종 논문에는 14개 팀이 방법을 기여했다.
- 알고리즘은 세 가지 외부 데이터세트(REFUGE, GAMMA, DRIMDB)에서 평가될 때 강건한 성능을 보였다.
- 데이터세트는 현재까지 공개된 CFP 녹내장 라벨 데이터셋 중 가장 큰 것으로, 60k명의 환자를 500개 사이트에 걸쳐 다양한 카메라 유형으로 포괄한다.
- 도전 설계(Type 2 제출 및 필터링되지 않은 테스트 세트)가 재현성과 현실 세계의 관련성을 높인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.