Skip to main content
QUICK REVIEW

[論文レビュー] RVD: A Handheld Device-Based Fundus Video Dataset for Retinal Vessel Segmentation

MD Wahiduzzaman Khan, Hongwei Sheng|arXiv (Cornell University)|Jul 13, 2023
Retinal Imaging and AnalysisMedicine被引用数 3
ひとこと要約

本論文は、ハンズオンスマートフォンを用いて収集された、動画ベースの網膜血管分離データセットRVDを紹介する。415名の50〜75歳の患者から得られた635本の動画を含み、二値、一般、微細な静脈動脈マスクという多段階の空間的アノテーションに加え、血管の拍動を示す時間的アノテーションを提供する。これらのアノテーションは、既存のモデルが直面する重大なドメインシフトを明らかにし、VTNにおけるSVP局在化タスクのmIoUが51.25%にとどまるなど、新規手法の開発が不可欠であることを示している。

ABSTRACT

Retinal vessel segmentation is generally grounded in image-based datasets collected with bench-top devices. The static images naturally lose the dynamic characteristics of retina fluctuation, resulting in diminished dataset richness, and the usage of bench-top devices further restricts dataset scalability due to its limited accessibility. Considering these limitations, we introduce the first video-based retinal dataset by employing handheld devices for data acquisition. The dataset comprises 635 smartphone-based fundus videos collected from four different clinics, involving 415 patients from 50 to 75 years old. It delivers comprehensive and precise annotations of retinal structures in both spatial and temporal dimensions, aiming to advance the landscape of vasculature segmentation. Specifically, the dataset provides three levels of spatial annotations: binary vessel masks for overall retinal structure delineation, general vein-artery masks for distinguishing the vein and artery, and fine-grained vein-artery masks for further characterizing the granularities of each artery and vein. In addition, the dataset offers temporal annotations that capture the vessel pulsation characteristics, assisting in detecting ocular diseases that require fine-grained recognition of hemodynamic fluctuation. In application, our dataset exhibits a significant domain shift with respect to data captured by bench-top devices, thus posing great challenges to existing methods. In the experiments, we provide evaluation metrics and benchmark results on our dataset, reflecting both the potential and challenges it offers for vessel segmentation tasks. We hope this challenging dataset would significantly contribute to the development of eye disease diagnosis and early prevention.

研究の動機と目的

  • 静的でベンチトップの画像ベースのデータセットでは捉えきれない、拍動を含む動的網膜血管特性を捉えること。
  • 従来の網膜画像撮影のスケーラビリティおよびアクセス性の問題を、ポータブルでスマートフォンベースのデバイスを用いたデータ収集によって克服すること。
  • 包括的な空間的および時間的アノテーションを備えた大規模で多様性に富み、臨床的に関連性の高い動画データセットを提供すること。
  • 網膜血管の動態に関する研究を促進し、糖尿病網膜症や緑内障などの眼疾患の早期診断を向上させること。
  • 網膜画像解析におけるドメイン一般化およびモデルの頑健性を評価するベンチマークを確立すること。

提案手法

  • 4か所の臨床施設で、ハンズオンスマートフォンを用いて635本の網膜動画を収集し、現実世界のばらつきとアクセス性を確保した。
  • 各動画から最も鮮明なフレームを選別し、全体の血管構造を表す高品質な二値血管マスクを生成した。
  • 太さ(カリブレ)に基づいて血管を区別することで、静脈・動脈の区別が可能な一般化された静脈動脈マスクを作成した。
  • 各血管を太さに基づくサブセクションに分割することで、微細な静脈動脈マスクを生成し、1本の動画あたり8つの異なるマスクを生成した。
  • 網膜ディスク領域における血管拍動幅が最大および最小となるフレームを特定することで、時間的ダイナミクスをアノテートした。
  • RVDと既存の画像ベースのデータセットとの間のドメインギャップを定量化するために、クロスデータセットテストを含む包括的な評価プロトコルを確立した。

実験結果

リサーチクエスチョン

  • RQ1最先端の網膜血管分離モデルは、RVDのような動画ベースでハンズオンデバイスで収集されたデータセット上で、どの程度一般化するか?
  • RQ2既存のモデルは、現実世界の動画データにおいて、微細な網膜血管拍動(SVP)をどの程度正しく検出・局在化できないか?
  • RQ3強度分布および構造的ダイナミクスの観点から、RVDと従来の画像ベースの網膜データセットとの間の主なドメインギャップは何か?
  • RQ4二値、一般、微細な多段階空間的アノテーションは、血管分離モデルの性能と臨床的有用性にどのように影響するか?
  • RQ5血管拍動の時間的アノテーションは、血行動態解析を要する眼疾患の検出を向上させることができるか?

主な発見

  • 既存の画像ベースのデータセットで訓練されたモデルは、RVDでテストされた際、顕著な性能低下を示し、顕著なドメインギャップが存在することが明らかになった。
  • SVP局在化タスクは依然として極めて困難であり、VTNがRVDで51.25%のmIoUにとどまったことから、時間的モデリングに特化した手法の開発が不可欠であることが示された。
  • Swin-B-22kはクロスデータセット評価において、二値分離タスクで78.67%の最高mIoUを達成し、大規模事前学習の利点を示した。
  • 強度分布の違いがドメインギャップに影響することを図1(c)が示しており、モデルの一般化に影響を与えることが明らかになった。
  • 微細な静脈動脈マスクは、アノテーションの複雑さと臨床的関連性を著しく高め、血管病変の粒度の細かい分析を可能にした。
  • 本データセットが備える豊富な空間的・時間的アノテーションは、動的網膜解析および眼疾患検出分野における新たな研究分野を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。