[論文レビュー] OLIVES Dataset: Ophthalmic Labels for Investigating Visual Eye Semantics
OLIVESデータセットは、96名の被験者を対象に2年を超える期間にわたり収集された、近赤外線眼底写真、OCTスキャン、臨床的ラベル、バイオマーカーのアノテーション、疾患診断(糖尿病網膜症/DME)、縦断的治療データを統合した包括的でマルチモーダルな眼科データセットを提供する。これにより、マルチモーダル学習、バイオマーカー解釈、時系列治療モデリングに関する新規研究が可能となり、臨床的および機械学習研究の分野において、すべての主要な眼科的データモダリティにわたる構造的かつキュレートされたラベルを備えた、初めてのデータセットを提供する。
The webpage associated with this dataset can be found here. Clinical diagnosis of the eye is performed over multifarious data modalities including scalar clinical labels, vectorized biomarkers, two-dimensional fundus images, and three-dimensional Optical Coherence Tomography (OCT) scans. While the clinical labels, fundus images and OCT scans are instrumental measurements, the vectorized biomarkers are interpreted attributes from the other measurements. Clinical practitioners use all these data modalities for diagnosing and treating eye diseases like Diabetic Retinopathy (DR) or Diabetic Macular Edema (DME). Enabling usage of machine learning algorithms within the ophthalmic medical domain requires research into the relationships and interactions between these relevant data modalities. Existing datasets are limited in that: (i) they view the problem as disease prediction without assessing biomarkers, and (ii) they do not consider the explicit relationship among all four data modalities over the treatment period. In this paper, we introduce the Ophthalmic Labels for Investigating Visual Eye Semantics (OLIVES) dataset that addresses the above limitations. This is the first OCT and fundus dataset that includes clinical labels, biomarker labels, and time-series patient treatment information from associated clinical trials. The dataset consists of $1268$ fundus eye images each with 49 OCT scans, and 16 biomarkers, along with 3 clinical labels and a disease diagnosis of DR or DME. In total, there are 96 eyes' data averaged over a period of at least two years with each eye treated for an average of 66 weeks and 7 injections. OLIVES dataset has advantages in other fields of machine learning research including self-supervised learning as it provides alternate augmentation schemes that are medically grounded.
研究の動機と目的
- 臨床的、画像的、バイオマーカー的、治療的データを時間的経過にわたって統合した、統合的でマルチモーダルな眼科データセットの不足に対処すること。
- 眼底画像、OCTスキャン、時系列治療記録の各分野に構造的かつキュレートされたラベルを提供することにより、眼科分野における包括的で包括的な機械学習研究を支援すること。
- バイオマーカーの解釈およびそれらが疾患状態や治療成績に与える影響の関係を研究可能にする。
- 視覚的目の意味論および疾患進行予測のための自己教師あり学習およびマルチモーダル学習モデルの開発を促進すること。
提案手法
- 本データセットは、2013年から2021年までにテキサス州レティナ・コンサルタンツで実施された2つの前向きランダム化臨床試験(PRIMEおよびTREX-DME)から構築された。
- 1眼あたり少なくとも49枚のOCTスキャンを含み、合計で78,185枚の画像を含む1268枚の近赤外線眼底写真が含まれる。
- 臨床的ラベル(例:BCVA、患者ID)および疾患診断(DRまたはDME)は、匿名化された電子的医療記録(EMR)から抽出された。
- バイオマーカー(例:網膜内浮腫、嚢胞様変化)は、経験豊富なグレーダーがオープン・アドゥカーション方式を用いて後向きにアノテーションされた。
- 本データセットには、平均66週間の治療期間にわたり1人あたり7回の注射を含む時系列治療データが含まれる。
- すべてのデータは、マルチモーダルで、時間的要因を考慮した、バイオマーカーに配慮した機械学習研究を支援するように構造化され、キュレートされている。
実験結果
リサーチクエスチョン
- RQ1マルチモーダル学習モデルは、臨床的ラベル、バイオマーカー、画像データ(眼底写真およびOCT)を効果的に統合することで、眼科診断の精度をどのように向上させることができるか?
- RQ2DMEおよびDR進行における、縦断的治療パターンとバイオマーカーの変化との関係は何か?
- RQ3OCTスキャンから抽出されたバイオマーカーは、時間経過に伴い臨床的成績や疾患の重症度とどのように相関するか?
- RQ4自己教師あり学習手法は、OCTスキャンおよび治療履歴の時間的構造を活用することで、眼科画像における表現学習をどのように改善できるか?
- RQ5画像データに加えてバイオマーカーのアノテーションを組み込むことで、モデルの予測精度はどの程度向上するか?
主な発見
- OLIVESデータセットは、78,185枚の画像(1眼あたり少なくとも49枚のOCTスキャン)を含む96眼から構成され、1スキャンあたり16種類の異なるバイオマーカーが存在する。
- 本データセットには、BCVAなどの4つの臨床的ラベルおよびDRまたはDMEの疾患診断ラベルが含まれており、平均66週間、1人あたり7回の注射を含む縦断的治療データが収録されている。
- バイオマーカーのアノテーションは、経験豊富なグレーダーによるオープン・アドゥカーション方式を通じて検証され、高い信頼性と意味的整合性が確保された。
- 本データセットは、画像データ、バイオマーカー、時系列治療パターンを統合するマルチモーダルモデルのベンチマークが可能である。
- OLIVESは、自己教師あり学習、バイオマーカー解釈、治療予測に関する新規な研究分野を支援し、現在の眼科データセットにおける重要な空白を埋める。
- 本データセットは、縦断的臨床研究を目的とした、すべての主要な眼科的データモダリティを統合し、構造的かつキュレートされたリソースを提供する最初のものである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。