Skip to main content
QUICK REVIEW

[論文レビュー] Generating Highly Realistic Images of Skin Lesions with GANs

Christoph Baur, Shadi Albarqouni|arXiv (Cornell University)|Sep 5, 2018
Cutaneous Melanoma Detection and Management被引用数 6
ひとこと要約

本論文では、皮膚病変の高解像度で極めてリアルな真皮顕微鏡画像(256×256ピクセル)を生成するために、プログレッシブグローニング GAN(PGAN)の使用を提案している。DCGAN や LAPGAN よりも顕著に向上した。皮膚科専門医およびディープラーニング専門家が視覚的チューリングテストにおいて合成画像と本物の画像を信頼性を持って区別できず、医療画像合成分野で最先端のリアルさを示した。

ABSTRACT

As many other machine learning driven medical image analysis tasks, skin image analysis suffers from a chronic lack of labeled data and skewed class distributions, which poses problems for the training of robust and well-generalizing models. The ability to synthesize realistic looking images of skin lesions could act as a reliever for the aforementioned problems. Generative Adversarial Networks (GANs) have been successfully used to synthesize realistically looking medical images, however limited to low resolution, whereas machine learning models for challenging tasks such as skin lesion segmentation or classification benefit from much higher resolution data. In this work, we successfully synthesize realistically looking images of skin lesions with GANs at such high resolution. Therefore, we utilize the concept of progressive growing, which we both quantitatively and qualitatively compare to other GAN architectures such as the DCGAN and the LAPGAN. Our results show that with the help of progressive growing, we can synthesize highly realistic dermoscopic images of skin lesions that even expert dermatologists find hard to distinguish from real ones.

研究の動機と目的

  • 皮膚病変画像解析における慢性的なラベル付きデータ不足とクラス分布の偏りという問題に対処する。
  • 従来の GAN が低解像度の医療画像しか生成できないという制限を克服する。
  • 皮膚病変分類およびセグメンテーションモデルのトレーニングデータを改善するため、高解像度でリアルな真皮顕微鏡画像を生成する。
  • 視覚的チューリングテストを通じて、専門皮膚科医およびディープラーニング専門家を用いて合成画像のリアルさを評価する。
  • PGAN が DCGAN や LAPGAN よりも高解像度において画像品質、シャープネス、多様性の面で優れていることを示す。

提案手法

  • ISIC2018 チャレンジデータセットの真皮顕微鏡画像を用いて、プログレッシブグローニング GAN(PGAN)を 256×256 ピクセルの画像生成に訓練する。
  • プログレッシブグローニングを用いる:生成器および識別器の解像度を 4×4 から徐々に 256×256 まで段階的に増加させ、トレーニングを安定化する。
  • Fréchet Inception Distance(FID)および Inception Score(IS)といった定量的指標を用いて、PGAN を DCGAN や LAPGAN と比較する。
  • 皮膚科専門医 3 名およびディープラーニング専門家 5 名を対象に視覚的チューリングテストを実施し、リアルさを評価する。
  • 評価者に提示する前に画像に前処理(例:フィルタリング)を施さないことで、バイアスのない評価を保証する。
  • Fleiss のカappaを用いて評価者間の一貫性を分析し、本物と偽物の区別がどの程度一貫してなされたかを評価する。

実験結果

リサーチクエスチョン

  • RQ1PGAN は、皮膚病変の高解像度(256×256)画像を生成でき、専門皮膚科医を騙せるほどリアルなものを提供できるか?
  • RQ2高解像度において、PGAN は DCGAN や LAPGAN と比べて画像品質、シャープネス、アーティファクトのレベルで優れているか?
  • RQ3合成画像が本物の皮膚病変画像の統計的分布とどの程度一致するか?
  • RQ4盲検の視覚的チューリングテストにおいて、専門の人間の評価者が本物と合成画像を信頼性を持って区別できるか?
  • RQ5PGAN が生成する画像の高品質なリアルさは、皮膚病変分類タスクにおける効果的なデータ拡張の可能性を示唆するか?

主な発見

  • PGAN が生成した画像は非常にリアルと評価され、視覚的チューリングテストにおいて皮膚科専門医およびディープラーニング専門家が本物と偽物を識別する精度がわずかにランダム(50%)よりわずかに高い水準にとどまった。
  • 評価者間の一貫性は極めて低く(Fleiss のカappaは 0 に近い)、本物と偽物の区別が一貫してできないことを示した。
  • PGAN は定量的指標(FID、IS)および定性的な評価の両面で DCGAN や LAPGAN を上回り、より優れたシャープネス、多様性、および少ないアーティファクトを示した。
  • 潜在空間の可視化により、サンプル間で滑らかな遷移が観察された。これは、モデルが訓練データを記憶したのではなく、意味のある多様体を学習したことを示している。
  • PGAN の FID スコアは、DCGAN や LAPGAN よりも顕著に低く、本物の画像との分布的類似度が高かったことを示した。
  • 高品質なリアルさにもかかわらず、一部の合成画像にはまだ不完全さが見られ、特に糸状構造のモデリングに課題が残っており、改善の余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。