[論文レビュー] DRStageNet: Deep Learning for Diabetic Retinopathy Staging from Fundus Images
DRStageNetは、7つの公開糖尿病網膜症(DR)データセットを対象に、マルチソースドメイン適応戦略を用いて微調整された自己教師ありビジョントランスフォーマーモデルであり、多様な臨床環境における一般化性能を向上させることを目的としている。高解像度のgrad-rollout説明可能性ヒートマップを提供し、ラベルの不正確さや合併症が存在する状況でも頑健性を示す。
Diabetic retinopathy (DR) is a prevalent complication of diabetes associated with a significant risk of vision loss. Timely identification is critical to curb vision impairment. Algorithms for DR staging from digital fundus images (DFIs) have been recently proposed. However, models often fail to generalize due to distribution shifts between the source domain on which the model was trained and the target domain where it is deployed. A common and particularly challenging shift is often encountered when the source- and target-domain supports do not fully overlap. In this research, we introduce DRStageNet, a deep learning model designed to mitigate this challenge. We used seven publicly available datasets, comprising a total of 93,534 DFIs that cover a variety of patient demographics, ethnicities, geographic origins and comorbidities. We fine-tune DINOv2, a pretrained model of self-supervised vision transformer, and implement a multi-source domain fine-tuning strategy to enhance generalization performance. We benchmark and demonstrate the superiority of our method to two state-of-the-art benchmarks, including a recently published foundation model. We adapted the grad-rollout method to our regression task in order to provide high-resolution explainability heatmaps. The error analysis showed that 59\% of the main errors had incorrect reference labels. DRStageNet is accessible at URL [upon acceptance of the manuscript].
研究の動機と目的
- トレーニングデータとデプロイメントデータの間のドメインシフトが原因で、糖尿病網膜症(DR)ステージングにおけるモデルの一般化性能が低いという課題に対処すること。
- 人種的背景、画像撮影プロトコル、ラベル品質の異なる多様なデータセットを統合し、マルチソースドメイン微調整を活用することで、DRステージングの性能を向上させること。
- 回帰ベースのDRステージングに適応したgrad-rollout法を用いて、高解像度の注意ヒートマップを生成することで、モデルの解釈可能性を向上させること。
- ラベルの不正確さや合併症が実際のデプロイメント環境におけるモデル性能と頑健性に与える影響を調査すること。
- 専門医と非専門医の両方が利用可能な、正確で説明可能な予測を提供する臨床的実用性のあるDRステージングシステムの開発
提案手法
- DRStageNetは、ImageNet-21kを用いた自己教師あり学習で事前学習されたビジョントランスフォーマー(DINOv2)を、DRステージングの特徴バックボーンとして採用している。
- モデルは、連続的なICDRステージ(0–4)を予測するシンプルな全結合回帰ヘッドを用い、順序関係を保持するため、ステージングを回帰問題として扱っている。
- ドメイン一般化を向上させるために、7つの公開データセット(例:EYEPACS、IDRiD、DDR)を対象にマルチソースドメイン微調整(MST)戦略を適用している。
- ICDRスケールにおける回帰性能を最適化するために、平均二乗誤差(MSE)損失を用いて微調整を行っている。
- 回帰タスクに適応したgrad-rollout注視可視化手法を採用し、高解像度でクラスに依存しない説明可能性ヒートマップを生成している。
- 患者レベルのラベルが付与されたデータセット(例:DRTiD)を含む複数のターゲットドメインでモデルを評価し、ラベルのレベルでの不一致に対する頑健性を評価している。
![Figure 1: DRStageNet consists of a DINOv2 [ 19 ] pretrained backbone that is joined with a simple fully connected regression head. Additionally, we utilize a multi-source domain fine-tuning approach by combining seven open source DR datasets. DRStageNet is fine-tuned using the MSE loss.](https://ar5iv.labs.arxiv.org/html/2312.14891/assets/figures/method_dr2.png)
実験結果
リサーチクエスチョン
- RQ1非重複するドメインサポートを持つ多様な臨床データセットにおいて、マルチソースドメイン微調整が、ドメインシフトに起因する糖尿病網膜症ステージングのための深層学習モデルの一般化性能を向上させることができるか?
- RQ2分布シフト下において、自己教師ありビジョントランスフォーマーベースとの比較で、教師ありまたは他の事前学習戦略がDRステージングに与える影響は?
- RQ3公開データセットにおけるラベルの不正確さや合併症が、DRステージングモデルの性能と信頼性に及ぼす影響の程度は?
- RQ4適応されたgrad-rollout注視可視化は、回帰ベースのDRステージング予測に対して臨床的に意味のある高解像度の説明を提供できるか?
- RQ5順序制約を課した回帰タスクとしてDRステージングをモデル化することで、多値分類と比較して性能と頑健性が向上するか?
主な発見
- DRStageNetは、最近のファウンデーションモデルも含む2つの最先端ベンチマークを上回り、特に分布シフトを伴うターゲットドメインにおいて、クロスデータセット一般化性能が優れていた。
- マルチソースドメイン微調整戦略は、単一ソース微調整と比較して、一般化性能を顕著に向上させ、特定の1つのデータセットへの過学習を低減した。
- 主な予測誤差の59%が、トレーニングデータ内の誤った基準ラベルに起因しており、ラベル品質がモデル性能に与える影響が極めて重要であることが示された。
- 誤分類された画像の40%が、網膜症病変に類似するが、訓練データにあまり含まれない血管閉塞などの合併症と関連していた。
- DDRデータセットでは、grad-rollout説明可能性ヒートマップが、地面真理の病変セグメンテーションと強い空間的整合性を示したが、一部のDR特徴が見逃されたため、特定の病変にのみ注目している傾向が確認された。
- 2フィールドのDFA画像から患者レベルのICDRラベルが付与されたDRTiDデータセットでは、DRStageNetを含むすべてのモデルが性能を低下させた。これは、今後のモデルにおいて複数フィールドの画像統合が不可欠であることを示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。