Skip to main content
QUICK REVIEW

[論文レビュー] AD-GAN: End-to-end Unsupervised Nuclei Segmentation with Aligned Disentangling Training

Kai Yao, Kaizhu Huang|arXiv (Cornell University)|Jul 23, 2021
Generative Adversarial Networks and Image Synthesis参考文献 30被引用数 6
ひとこと要約

AD-GANは、コンテンツ(空間的構造)とスタイル(テクスチャ/レンダリング)を分離する表現学習を用いて、エンド・ツー・エンドの教師なし核セグメンテーションフレームワークを提案する。特筆すべきは、ドメイン間でコンテンツの一貫性を保つために、新しいアライメント済み分離訓練戦略を導入したことである。4つの核データセットにおいて、最先端の教師なし手法よりもDICEスコアで16.1%の相対的向上を達成しており、一部の教師ありモデルでさえも上回っている。

ABSTRACT

We consider unsupervised cell nuclei segmentation in this paper. Exploiting the recently-proposed unpaired image-to-image translation between cell nuclei images and randomly synthetic masks, existing approaches, e.g., CycleGAN, have achieved encouraging results. However, these methods usually take a two-stage pipeline and fail to learn end-to-end in cell nuclei images. More seriously, they could lead to the lossy transformation problem, i.e., the content inconsistency between the original images and the corresponding segmentation output. To address these limitations, we propose a novel end-to-end unsupervised framework called Aligned Disentangling Generative Adversarial Network (AD-GAN). Distinctively, AD-GAN introduces representation disentanglement to separate content representation (the underling spatial structure) from style representation (the rendering of the structure). With this framework, spatial structure can be preserved explicitly, enabling a significant reduction of macro-level lossy transformation. We also propose a novel training algorithm able to align the disentangled content in the latent space to reduce micro-level lossy transformation. Evaluations on real-world 2D and 3D datasets show that AD-GAN substantially outperforms the other comparison methods and the professional software both quantitatively and qualitatively. Specifically, the proposed AD-GAN leads to significant improvement over the current best unsupervised methods by an average 17.8% relatively (w.r.t. the metric DICE) on four cell nuclei datasets. As an unsupervised method, AD-GAN even performs competitive with the best supervised models, taking a further leap towards end-to-end unsupervised nuclei segmentation.

研究の動機と目的

  • 教師なし核セグメンテーションにおける損失を伴う変換問題に対処する。具体的には、入力画像と生成されたマスクの間でコンテンツの一貫性が失われる問題を解決すること。
  • CycleGANベースの二段階パイプラインに起因する制限を克服する。合成データに依存せず、エンド・ツー・エンドの訓練を可能にする。
  • 対応のない画像からマスクへの変換において、核の削除・追加・形状のずれといったマクロレベルおよびマイクロレベルのコンテンツ歪みを低減すること。
  • 核画像と合成マスクの両ドメインにおいて、分離されたコンテンツ表現を共有する共通の潜在空間を有する統合フレームワークを開発すること。
  • アノテーション済みセグメンテーションマスクを一切必要とせず、教師ありモデルと同等の性能を達成すること。

提案手法

  • 空間的構造(コンテンツ)とテクスチャ(スタイル)を分離するコンテンツ・スタイル分離自己符号化器ジェネレータを導入。各ドメインに1つのドメイン固有のスタイルが存在すると仮定する。
  • 核画像と合成マスクの間で翻訳方向を制御できる、ワンホットドメインラベルを備えた統合GANフレームワークを設計。
  • 潜在空間における分離済みコンテンツ表現を明示的にアライメントすることで、マイクロレベルの歪みを最小化する、新しいアライメント済み分離訓練戦略を実装。
  • コンテンツとスタイルの対応を強制するために、再構成損失($\mathcal{L}_{rec}$)、サイクル整合性損失($\mathcal{L}_{cyc}$)、コンテンツ再構成損失($\mathcal{L}_{ctr}$)の組み合わせを適用。
  • エンコーダーにAdaIN(適応的インスタンス正規化)を適用し、ドメイン固有の情報を注入し、翻訳方向をガイドする。
  • t-SNE可視化を用いて、提案された訓練スキーム下で、両ドメインからの分離済みコンテンツ表現が潜在空間で良好にアライメントされていることを確認。

実験結果

リサーチクエスチョン

  • RQ1分離表現学習は、核セグメンテーションにおける教師なし画像からマスクへの変換において、マクロレベルのコンテンツ損失を低減できるか?
  • RQ2アライメント済み分離訓練は、マスクの形状や位置のずれといったマイクロレベルの歪みを最小化するのにどの程度有効か?
  • RQ3二段階パイプラインに依存せず、誤った可能性のある合成データに依存しないエンド・ツー・エンドの訓練を可能にすることで、このフレームワークは二段階パイプラインの必要性を排除できるか?
  • RQ4AD-GANの性能は、合成マスク内の核の数の変動に対して、CycleGAN や UDCT と比較してどの程度感度を示すか?
  • RQ5完全に教師なしであるにもかかわらず、AD-GANは教師ありモデルと同等の性能を達成できるか?

主な発見

  • AD-GANは、4つの2Dおよび3D核データセットにおいて、既存の最良の教師なし手法よりもDICEスコアで16.1%の相対的向上を達成した。
  • この手法は、核の数や空間的構造の維持に伴うマクロレベルの損失を顕著に低減し、削除や追加が発生しない。
  • 潜在空間におけるアライメント済み分離訓練戦略のおかげで、形状や位置のずれといったマイクロレベルの歪みが顕著に低減された。
  • AD-GANは、合成マスク内の核の数の変動に対して高いロバスト性を示し、さまざまな設定でも安定した性能を発揮した。これに対して、CycleGAN や UDCT は10%以上の性能差を示した。
  • 定性的な結果から、AD-GANは目に見える形状の違いや位置のずれのないセグメンテーションマスクを生成しており、より現実的かつ正確な出力を得ていることが明らかになった。
  • モデルは最先端の教師ありセグメンテーションモデルと同等の性能を発揮しており、エンド・ツー・エンドの教師なし核セグメンテーションへの大きな飛躍を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。