[논문 리뷰] OLIVES Dataset: Ophthalmic Labels for Investigating Visual Eye Semantics
OLIVES 데이터셋은 2년 이상의 시간 동안 96명의 환자로부터 수집된 근적외선 망막 영상, OCT 스캔, 임상 레이블, 생물학적 표지자 주석, 질병 진단(DR/DME), 종단적 치료 데이터를 포함하는 종합적이고 다중 모odal한 망막 질환 데이터셋을 제공한다. 이는 다중 모달러닝, 생물학적 표지자 해석, 시간적 시리즈 치료 모델링 분야에서의 새로운 연구를 가능하게 하며, 임상 및 기계학습 연구를 위한 모든 핵심 망막 영상 자료 모달리티에 대해 구조화되고 정제된 레이블을 제공하는 최초의 데이터셋이다.
The webpage associated with this dataset can be found here. Clinical diagnosis of the eye is performed over multifarious data modalities including scalar clinical labels, vectorized biomarkers, two-dimensional fundus images, and three-dimensional Optical Coherence Tomography (OCT) scans. While the clinical labels, fundus images and OCT scans are instrumental measurements, the vectorized biomarkers are interpreted attributes from the other measurements. Clinical practitioners use all these data modalities for diagnosing and treating eye diseases like Diabetic Retinopathy (DR) or Diabetic Macular Edema (DME). Enabling usage of machine learning algorithms within the ophthalmic medical domain requires research into the relationships and interactions between these relevant data modalities. Existing datasets are limited in that: (i) they view the problem as disease prediction without assessing biomarkers, and (ii) they do not consider the explicit relationship among all four data modalities over the treatment period. In this paper, we introduce the Ophthalmic Labels for Investigating Visual Eye Semantics (OLIVES) dataset that addresses the above limitations. This is the first OCT and fundus dataset that includes clinical labels, biomarker labels, and time-series patient treatment information from associated clinical trials. The dataset consists of $1268$ fundus eye images each with 49 OCT scans, and 16 biomarkers, along with 3 clinical labels and a disease diagnosis of DR or DME. In total, there are 96 eyes' data averaged over a period of at least two years with each eye treated for an average of 66 weeks and 7 injections. OLIVES dataset has advantages in other fields of machine learning research including self-supervised learning as it provides alternate augmentation schemes that are medically grounded.
연구 동기 및 목표
- 임상, 영상, 생물학적 표지자, 치료 데이터를 시간에 따라 연결하는 통합된 다중 모달 망막 질환 데이터셋의 부족을 해결하기 위해.
- 망막 영상, OCT 스캔, 시간적 시리즈 치료 기록 전반에 걸쳐 구조화되고 정제된 레이블을 제공하여 망막 질환 분야에서 통합적인 기계학습 연구를 지원하기 위해.
- 생물학적 표지자 해석 및 그 질병 상태와 치료 결과와의 관계를 연구할 수 있도록 하기 위해.
- 시각적 눈의 의미 및 질환 진행 예측을 위한 자기지도 학습 및 다중 모달러닝 모델의 개발을 촉진하기 위해.
제안 방법
- 이 데이터셋은 2013년에서 2021년 사이에 텍사스 망막 전문의원에서 실시된 두 개의 후향적 무작위 대조 임상 시험(PRIME 및 TREX-DME)의 자료를 바탕으로 구축되었다.
- 1268장의 근적외선 망막 영상과 한 눈당 최소 49장의 OCT 스캔을 포함하며, 총 96개의 눈에서 78,185장의 영상이 포함되어 있다.
- 임상 레이블(예: BCVA, 환자 ID)과 질병 진단(DR 또는 DME)은 익명화된 전자 의무기록에서 추출되었다.
- 생물학적 표지자(예: 망막내 체액, 낭성 변화)는 경험 많은 평가자가 개방형 재판단 방식을 통해 후행적으로 주석을 달았다.
- 이 데이터셋에는 평균 66주 동안 7회 정도의 주사 치료 기록을 포함한 시간적 시리즈 치료 데이터가 포함되어 있다.
- 모든 데이터는 다중 모달러닝, 시간적 분석, 생물학적 표지자 인식 기반 기계학습 연구를 지원하도록 구조화되고 정제되었다.
실험 결과
연구 질문
- RQ1다중 모달러닝 모델은 임상 레이블, 생물학적 표지자, 영상 자료(Fundus 및 OCT)를 어떻게 효과적으로 통합하여 망막 질환 진단을 향상시킬 수 있는가?
- RQ2DME 및 DR 진행 과정에서 종단적 치료 패턴과 생물학적 표지자 변화 사이의 관계는 어떠한가?
- RQ3OCT 스캔에서 추출한 생물학적 표지자들은 시간이 지남에 따라 임상 결과와 질병의 중증도와 어떻게 관련이 있는가?
- RQ4자기지도 학습 방법은 OCT 스캔의 시간적 구조와 치료력 기록을 어떻게 활용하여 망막 영상의 표현 학습을 향상시킬 수 있는가?
- RQ5이미지 자료와 생물학적 표지자 주석을 함께 통합할 경우 모델 예측 성능은 어느 정도 향상되는가?
주요 결과
- OLIVES 데이터셋은 96개의 눈에서 총 78,185장의 영상으로 구성되어 있으며, 한 눈당 최소 49장의 OCT 스캔과 16종의 다양한 생물학적 표지자 주석이 포함되어 있다.
- 이 데이터셋은 BCVA 등 4종의 임상 레이블과 DR 또는 DME에 대한 질병 진단 레이블을 포함하며, 평균 66주, 환자당 약 7회 주사 치료 기록이 포함되어 있다.
- 생물학적 표지자 주석은 경험 많은 평가자가 개방형 재판단 방식을 통해 검증되어 높은 신뢰성과 의미 일관성을 확보하였다.
- 이 데이터셋은 영상 자료, 생물학적 표지자, 시간적 시리즈 치료 패턴을 통합하는 다중 모달러닝 모델의 벤치마킹을 가능하게 한다.
- OLIVES는 자기지도 학습, 생물학적 표지자 해석, 치료 예측 분야에서의 새로운 연구 방향을 지원하며, 기존 망막 질환 데이터셋에서의 핵심적 공백을 메운다.
- 이 데이터셋은 종합적이고 정제된, 모든 핵심 망막 영상 자료 모달리티를 통합한 유일한 자료로서 종단적 임상 연구를 위한 구조화된 자료를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.