Skip to main content
QUICK REVIEW

[論文レビュー] Synthesizing Filamentary Structured Images with GANs

He Zhao, Huiqi Li|arXiv (Cornell University)|Jun 7, 2017
Generative Adversarial Networks and Image Synthesis参考文献 28被引用数 20
ひとこと要約

本稿では、二値の真値マップから網状構造を有する生体医療画像(網膜画像や神経細胞画像など)を現実的につくるGANベースのモデル、Fila-GANおよびFila-sGANを提案する。本手法は、たった10例のトレーニング例からも多様で高品質なフォントを生成し、データ増強に用いることで、下流のセグメンテーション性能を最大1.18% F1スコア向上させる。

ABSTRACT

This paper aims at synthesizing filamentary structured images such as retinal fundus images and neuronal images, as follows: Given a ground-truth, to generate multiple realistic looking phantoms. A ground-truth could be a binary segmentation map containing the filamentary structured morphology, while the synthesized output image is of the same size as the ground-truth and has similar visual appearance to what have been presented in the training set. Our approach is inspired by the recent progresses in generative adversarial nets (GANs) as well as image style transfer. In particular, it is dedicated to our problem context with the following properties: Rather than large-scale dataset, it works well in the presence of as few as 10 training examples, which is common in medical image analysis; It is capable of synthesizing diverse images from the same ground-truth; Last and importantly, the synthetic images produced by our approach are demonstrated to be useful in boosting image analysis performance. Empirical examination over various benchmarks of fundus and neuronal images demonstrate the advantages of the proposed approach.

研究の動機と目的

  • 網膜および神経細胞画像解析において、手動セグメンテーションが高コストで希少であるという限られたアノテーション付き生体医療画像の課題に対処する。
  • 大規模なデータセットを必要とせず、医療画像で一般的な小規模データセットにおいても効果を発揮するデータ駆動型画像合成手法を開発する。
  • 1つの真値マップ入力から多様で現実的なフォントを生成し、トレーニングのためのデータばらつきを向上させる。
  • 合成画像をトレーニングデータとして用いることで、下流の画像セグメンテーションモデルの性能が向上することを実証する。
  • 従来のルールベースやドメイン知識に依存する手法とは異なり、スタイル変換の原則を統合したエンドツーエンドのGANベースの新規アプローチを提供する。

提案手法

  • 条件付きGANを、網状構造画像の生成に適応し、入力として二値セグメンテーションマップを用いる。
  • 実画像からの現実的なテクスチャーや外観を合成出力に転送するため、GANフレームワークにスタイル変換技術を統合する。
  • STAREやDRIVEのようなベンチマークから、たった10例程度の実画像を用いてトレーニングし、フェイシュートラーニングを実現する。
  • 細粒度の網状構造を保持し、視覚的リアリズムを向上させるために、マルチスケールディスクリミネーターとパーリプティブ損失を用いる。
  • 2つのバリアントをトレーニングする:Fila-GAN(標準GAN)およびFila-sGAN(スタイル正則化GAN)、後者はスタイルの一貫性を強調する。
  • 40万枚の合成画像パッチを生成し、実画像パッチと組み合わせてセグメンテーションモデルのファインチューニングに用いることで、トレーニングデータを拡張する。

実験結果

リサーチクエスチョン

  • RQ110~20例の実トレーニング例しか利用できない状況でも、GANベースのモデルが現実的な網状構造画像を効果的に合成できるか?
  • RQ2同じ真値マップ入力から、多様で視覚的に妥当なフォントを生成でき、データばらつきが向上するか?
  • RQ3合成画像をトレーニングデータとして用いることで、下流の画像セグメンテーションモデルの性能が向上するか?
  • RQ4実画像+合成画像でトレーニングしたモデルの性能は、実画像のみでトレーニングしたモデルと比べてどうなるか?
  • RQ5本手法は、網膜フンダス画像や神経細胞画像など、異なる生体医療画像タイプに一般化可能か?

主な発見

  • DRIVE網膜画像ベンチマークにおいて、実画像+合成画像でトレーニングしたセグメンテーションモデルのF1スコアは79.15%から80.33%に向上し、明確な性能向上が確認された。
  • 2倍の実画像トレーニング設定(40万実パッチ)では、最高の性能80.70% F1スコアを達成し、合成データが有益であるが、実データの完全な代替にはならないことが裏付けられた。
  • Fila-sGANバリアントでは、実画像+合成画像でトレーニングした設定でDRIVEで80.49% F1スコアを達成し、両モデルバリアントで一貫した性能向上が確認された。
  • 視覚的比較では、実画像でトレーニングしたモデルが合成フォントに対しても良好に一般化しており、やや少ない誤検出だが、細い血管セグメントの欠落が目立った。
  • 合成画像は視覚的に現実的で多様であり、主に異なるサンプル間で細く繊細な網状構造にばらつきが見られた。
  • ベースラインモデルを上回り、DRIU(82.20% F1スコア)などの最先端のセグメンテーション手法と比較しても競争力のある結果を達成した。これは、データ増強における強力な潜在能力を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。