Skip to main content
QUICK REVIEW

[論文レビュー] A Two Stage GAN for High Resolution Retinal Image Generation and Segmentation

Paolo Andreini, Simone Bonechi|arXiv (Cornell University)|Jul 29, 2019
Retinal Imaging and Analysis被引用数 5
ひとこと要約

本論文では、少数の実際の訓練サンプルのみを用いて、高解像度の網膜画像とその対応するセマンティック血管ラベルマップを生成する2段階のGANフレームワークを提案する。まず、プログレッシブに成長するGAN(PGGAN)が現実的な血管マスクを合成する。次に、画像対画像変換モデル(例:Pix2Pixまたは類似手法)がこれらのマスクを写真的にリアルな網膜画像に変換する。生成されたデータを用いることで、事前学習後に実データでの微調整を施すことで、DRIVEおよびCHASE_DB1ベンチマークの両方で、既存の手法を上回る最先端の網膜血管セグメンテーション性能が達成される。

ABSTRACT

In recent years, the use of deep learning is becoming increasingly popular in computer vision. However, the effective training of deep architectures usually relies on huge sets of annotated data. This is critical in the medical field where it is difficult and expensive to obtain annotated images. In this paper, we use Generative Adversarial Networks (GANs) for synthesizing high quality retinal images, along with the corresponding semantic label-maps, to be used instead of real images during the training process. Differently from other previous proposals, we suggest a two step approach: first, a progressively growing GAN is trained to generate the semantic label-maps, which describe the blood vessel structure (i.e. vasculature); second, an image-to-image translation approach is used to obtain realistic retinal images from the generated vasculature. By using only a handful of training samples, our approach generates realistic high resolution images, that can be effectively used to enlarge small available datasets. Comparable results have been obtained employing the generated images in place of real data during training. The practical viability of the proposed approach has been demonstrated by applying it on two well established benchmark sets for retinal vessel segmentation, both containing a very small number of training samples. Our method obtained better performances with respect to state-of-the-art techniques.

研究の動機と目的

  • 医療分野のディープラーニングにおいて、注釈付き網膜画像データセットが限られているという重要な課題に対処すること。
  • 正確なセマンティックアノテーションを伴う高解像度で現実的な医療画像を生成する困難さを克服すること。
  • 多様で高品質な網膜画像および対応する血管セグメンテーションマスクを、データ効率的に合成する手法を開発すること。
  • 合成データが深層セグメンテーションネットワークの事前学習に効果的に機能し、少数の実データセットでも性能向上をもたらすことを実証すること。
  • 合成データ拡張を活用することで、わずか数枚の実画像のみで最先端の血管セグメンテーション結果を達成すること。

提案手法

  • 少数の実際の網膜ラベルマップを用いて、プログレッシブに成長するGAN(PGGAN)を訓練し、高解像度のセマンティック血管マスクを生成する。
  • 生成されたラベルマップを、条件付き画像対画像変換ネットワーク(例:Pix2Pixまたは類似手法)の入力として用い、現実的な網膜画像を合成する。
  • 2段階の設計により、セマンティック構造の生成と視覚的リアリズムの生成を分離することで、GPUメモリ消費量を低減し、訓練の安定性を向上させる。
  • データ拡張の目的で、1データセットあたり10,000組の合成画像-ラベルペアを生成する(DRIVEおよびCHASE_DB1)。
  • セグメンテーションマルチスケールアテンションネットワーク(SMANet)を、合成データのみ、実データのみ、および合成データで事前学習した後、実データで微調整する3つのプロトコルで訓練する。
  • 本手法により、合成データで事前学習することで一般化性能が向上し、その後実データでの微調整が有効に機能する、効果的な転移学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1少数の実際の訓練サンプルのみを用いて、2段階のGANパイプラインが高解像度で現実的な網膜画像と正確なセマンティック血管ラベルマップを生成できるか?
  • RQ2本手法で生成された合成データが、ディープラーニングベースの網膜血管セグメンテーション性能を効果的に向上させるか?
  • RQ3合成データで事前学習した後、実データで微調整することで、実データでの学習のみに比べて性能が向上するか、特にデータが少ない状況下で?
  • RQ4本手法の性能が、ベンチマークとしての網膜血管セグメンテーションデータセット(DRIVEおよびCHASE_DB1)において、最先端の技術と比較してどうなるか?
  • RQ5セマンティック構造と視覚的外観の生成を分離することで、画像品質および訓練効率がどの程度向上するか?

主な発見

  • 合成データを用いてSMANetを訓練した結果、DRIVEデータセットではAUCが98.65%、正答率が96.90%を達成し、実データのみで学習した場合と同等の性能を示した。
  • CHASE_DB1データセットでは、AUCが99.16%、正答率が97.72%を達成し、このベンチマークで報告されたこれまでのすべての結果を上回った。
  • 実データでの学習に比べ、合成データで事前学習した後、実データで微調整することで、DRIVEではAUCが0.17ポイント、CHASE_DB1では0.34ポイント向上した。
  • 合成データのみで訓練したSMANetは、実データで訓練した場合と同等の性能を達成しており、合成画像が実際のデータ分布を効果的に捉えていることを示している。
  • 2段階アプローチにより、エンドツーエンドのGAN訓練に比べてGPUメモリ要件が低減され、リソースが限られた環境でも高解像度画像生成が可能になった。
  • 本フレームワークは汎用的であり、網膜画像に限定されず、他の医療画像分野への応用が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。