Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Information Fusion for Glaucoma and DR Classification

Yihao Li, Mostafa El Habib Daho|arXiv (Cornell University)|Sep 2, 2022
Retinal Imaging and Analysis被引用数 4
ひとこと要約

本稿では、網膜疾患診断におけるマルチモodalディープラーニングのための新しい階層的融合手法を提案する。2次元のフンダス写真、3次元のOCT、OCT血行動態画像データを統合することで、緑内障および糖尿病網膜症の診断を向上させる。本手法は、複数のネットワーク次元にわたるクロスモーダル相関をモデル化することで、初期融合や中間融合を上回る性能を発揮し、GAMMAデータセットではKappa 0.8996、PlexEliteDRデータセットではAUC 0.911を達成した。

ABSTRACT

Multimodal information is frequently available in medical tasks. By combining information from multiple sources, clinicians are able to make more accurate judgments. In recent years, multiple imaging techniques have been used in clinical practice for retinal analysis: 2D fundus photographs, 3D optical coherence tomography (OCT) and 3D OCT angiography, etc. Our paper investigates three multimodal information fusion strategies based on deep learning to solve retinal analysis tasks: early fusion, intermediate fusion, and hierarchical fusion. The commonly used early and intermediate fusions are simple but do not fully exploit the complementary information between modalities. We developed a hierarchical fusion approach that focuses on combining features across multiple dimensions of the network, as well as exploring the correlation between modalities. These approaches were applied to glaucoma and diabetic retinopathy classification, using the public GAMMA dataset (fundus photographs and OCT) and a private dataset of PlexElite 9000 (Carl Zeis Meditec Inc.) OCT angiography acquisitions, respectively. Our hierarchical fusion method performed the best in both cases and paved the way for better clinical diagnosis.

研究の動機と目的

  • 単一モーダルティの網膜疾患分類の限界を克服するため、マルチモーダル画像データを活用すること。
  • フンダス写真、OCT、OCT血行動態画像からの補完的情報を統合することで、緑内障および糖尿病網膜症の診断精度を向上させること。
  • 複数のネットワーク次元にわたるクロスモーダル相関をモデル化することで、初期融合や中間融合よりも効果的な統合戦略を開発すること。
  • GAMMA(公的)およびPlexEliteDR(私的)の両データセットを用いて、本手法の階層的融合の有効性を検証し、臨床応用の堅牢性を確保すること。

提案手法

  • 深層畳み込みニューラルネットワークの複数の次元にわたり特徴を統合する階層的統合フレームワークを開発し、モーダルティ固有の表現とクロスモーダル表現の共同学習を可能にする。
  • 3次元畳み込みニューラルネットワークを用いて3次元OCTボリュームからの空間的特徴を抽出し、2次元/3次元CNNを用いてフンダス画像およびOCT血行動態画像データを処理する。
  • モーダルティ固有の特徴を段階的に結合し、その後にアテンション機構を適用することで、情報量の多いクロスモーダル相関を強調する。
  • GAMMAデータセットにおける最終予測の性能向上を図るため、ResNet50とResNet101のモデルアンサンブルを実装する。
  • 一般化性能の向上を目的として、ImageNetで事前学習済みのバックボーン(ResNet、DenseNet)を用いたデータオーグメンテーションおよび転移学習を実施する。
  • バッチ正規化および学習率スケジューリングを用いてトレーニングを最適化し、ハードウェア制約(例:ResNet152ではバッチサイズを縮小)に応じてバッチサイズを調整する。

実験結果

リサーチクエスチョン

  • RQ1階層的統合は、マルチモーダル網膜疾患分類において初期融合や中間融合を上回ることができるか?
  • RQ2フンダス画像とOCT画像の間の空間的不一致が統合性能に与える影響は何か?また、階層的統合はこの問題を緩和できるか?
  • RQ3OCT血行動態画像データの追加により、構造的OCTおよびフンダス画像のみの分類性能が向上するか?
  • RQ4異なるバックボーンアーキテクチャ(ResNet、DenseNet)は、階層的統合の性能にどのように影響を与えるか?
  • RQ5空間的整合性の程度が異なるデータセット間で、階層的統合は一般化可能か?

主な発見

  • 階層的統合手法はGAMMAデータセットでKappa 0.8996を達成し、中間統合(Kappa 0.7340)および単一モーダルティアプローチ(Kappa 0.6382)を顕著に上回った。
  • PlexEliteDRデータセットでは、DenseNet121を用いた階層的統合がAUC 0.911を達成し、単一モーダルティベースライン(AUC 0.859)および初期統合(AUC 0.865)を上回った。
  • GAMMAデータセットでは、フンダス画像とOCT画像の空間的不一致のため、中間統合が性能を発揮できず、アライメントなしでは特徴レベル統合の限界が顕在化した。
  • PlexEliteDRデータセットでは、モーダルティの空間的整合性が高いため、初期統合が良好な性能を示し、入力レベル統合における整合性の重要性を裏付けた。
  • 階層的統合モデルは優れた一般化性能を示し、複数のバックボーンおよびデータセットで最高の性能を達成した。
  • 階層的フレームワーク内でResNet50とResNet101のモデルをアンサンブルすることで、GAMMAデータセットのKappaは0.8996まで向上し、モデル多様性の利点を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。