Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Transfer Learning-based Approaches for Retinal Vascular Segmentation

José Morano, Álvaro S. Hervella|arXiv (Cornell University)|Dec 18, 2020
Retinal Imaging and Analysis参考文献 40被引用数 5
ひとこと要約

本論文は、ラベルなし網膜造影・血管造影画像ペアを用いた自己教師あり事前学習により、マルチモーダルな転移学習フレームワークを提案する。ラベルなしマルチモーダルデータを活用して完全畳み込みネットワーク(FCNs)を事前学習することで、限られたラベル付きデータでの微調整を最小限に抑えつつ、性能が著しく向上し、学習から開始するモデルや他のアーキテクチャと比較して、高い頑健性を示す。特にU-Netは、精度と一般化性能のバランスが最も優れている。

ABSTRACT

In ophthalmology, the study of the retinal microcirculation is a key issue in the analysis of many ocular and systemic diseases, like hypertension or diabetes. This motivates the research on improving the retinal vasculature segmentation. Nowadays, Fully Convolutional Neural Networks (FCNs) usually represent the most successful approach to image segmentation. However, the success of these models is conditioned by an adequate selection and adaptation of the architectures and techniques used, as well as the availability of a large amount of annotated data. These two issues become specially relevant when applying FCNs to medical image segmentation as, first, the existent models are usually adjusted from broad domain applications over photographic images, and second, the amount of annotated data is usually scarcer. In this work, we present multimodal transfer learning-based approaches for retinal vascular segmentation, performing a comparative study of recent FCN architectures. In particular, to overcome the annotated data scarcity, we propose the novel application of self-supervised network pretraining that takes advantage of existent unlabelled multimodal data. The results demonstrate that the self-supervised pretrained networks obtain significantly better vascular masks with less training in the target task, independently of the network architecture, and that some FCN architecture advances motivated for broad domain applications do not translate into significant improvements over the vasculature segmentation task.

研究の動機と目的

  • 医療画像分離における限られたラベル付き網膜画像の課題に対処する。
  • ラベルなしマルチモーダルデータを活用することで、網膜血管分離におけるデータ不足問題を克服する。
  • FCNベースの分離における転移学習のための、網膜造影・血管造影ペアを用いた自己教師あり事前学習の有効性を評価する。
  • U-Net、FC-DenseNet、ENetといった多様なFCNアーキテクチャの性能を、マルチモーダル再構成による事前学習の下で比較する。
  • 限られたデータ環境下で、性能、一般化性能、計算コストのバランスが最良となるネットワークアーキテクチャを特定する。

提案手法

  • ラベルなし網膜造影および血管造影画像ペアを用いた自己教師ありマルチモーダル再構成タスクにより、完全畳み込みネットワーク(FCNs)を事前学習する。
  • 事前学習済みエンコーダーを、限られたラベル付きデータにおける下流の網膜血管分離タスクの特徴抽出器として使用する。
  • 標準的な分離損失関数を用いて、ターゲットデータセット(DRIVEおよびSTARE)上で事前学習モデルをエンドツーエンドで微調整する。
  • 訓練の多様性を高め、一般化性能を向上させるために、データオーグメンテーション技術を適用する。
  • 同一の事前学習および微調整プロトコルを用いて、U-Net、FC-DenseNet、ENetのFCNアーキテクチャ間の性能を比較する。
  • テストセットにおける分離性能を評価するために、Dice係数、感受性、特異性などの指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしマルチモーダル網膜画像(網膜造影および血管造影)を用いた自己教師あり事前学習は、下流の血管分離性能を向上させることができるか?
  • RQ2事前学習を用いた場合と学習から開始する場合とを比較した場合、分離精度および収束速度の点でどの程度差が生じるか?
  • RQ3限られたラベル付きデータで微調整された場合、U-Net、FC-DenseNet、ENetのうちどのFCNアーキテクチャが最も優れた性能と一般化性能を達成するか?
  • RQ4マルチモーダルな事前学習の使用により、網膜血管分離における大規模ラベル付きデータセットへの依存度が低下するか?
  • RQ5一般用途のコンピュータビジョン分野でのアーキテクチャの進歩が、網膜血管分離分野へどの程度適用可能か?

主な発見

  • ラベルなし網膜造影・血管造影ペアを用いた自己教師あり事前学習は、最小限の微調整でも、学習から開始するモデルと比較して、顕著に血管分離性能が向上することが示された。
  • 事前学習戦略により、高い性能に到達するための訓練エポック数が削減され、収束が速いことが実証された。
  • U-NetはDRIVEおよびSTAREの両データセットで最も優れた分離性能を示し、特に病変を示す画像において優れた一般化性能を示した。
  • パラメータ数が少ないにもかかわらず、FC-DenseNetはそのアーキテクチャ的特性を十分に活かせず、特に挑戦的なSTAREデータセットではU-Netに劣った性能を示した。
  • ENetはU-Net や FC-DenseNetほど正確ではなかったが、事前学習を経ることで満足できる結果を達成したため、厳しい計算制約下でも実用的であると判明した。
  • マルチモーダルな事前学習アプローチは、小さな訓練データセットサイズに対しても頑健であり、限られたラベル付きデータでも高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。