Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Bottleneck Scene Generation

Samaneh Azadi, Michael Tschannen|arXiv (Cornell University)|Nov 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 45被引用数 8
ひとこと要約

本論文では、ランダムノイズからまず現実的なセマンティックセグメンテーションマップを合成し、その後そのマップを条件として高精細な画像を生成する、新しい生成モデルであるSemantic Bottleneck GAN (SB-GAN) を提案する。セグメンテーションネットワークと画像生成ネットワークをエンドツーエンドで訓練することで、CityscapesおよびADE-Indoorの無条件複雑シーン合成において、FIDスコアおよびユーザースタディーで最先端の性能を達成した。

ABSTRACT

Coupling the high-fidelity generation capabilities of label-conditional image synthesis methods with the flexibility of unconditional generative models, we propose a semantic bottleneck GAN model for unconditional synthesis of complex scenes. We assume pixel-wise segmentation labels are available during training and use them to learn the scene structure. During inference, our model first synthesizes a realistic segmentation layout from scratch, then synthesizes a realistic scene conditioned on that layout. For the former, we use an unconditional progressive segmentation generation network that captures the distribution of realistic semantic scene layouts. For the latter, we use a conditional segmentation-to-image synthesis network that captures the distribution of photo-realistic images conditioned on the semantic layout. When trained end-to-end, the resulting model outperforms state-of-the-art generative models in unsupervised image synthesis on two challenging domains in terms of the Frechet Inception Distance and user-study evaluations. Moreover, we demonstrate the generated segmentation maps can be used as additional training data to strongly improve recent segmentation-to-image synthesis networks.

研究の動機と目的

  • 条件付きGANが出力のための真値セグメンテーションマップを必要とすることによる制限を解消し、無条件シーン生成における柔軟性を高めること。
  • ラベル条件付きモデルの高精細な画像生成性能と、ノイズベースのGANの無条件な柔軟性を統合すること。
  • グローバルなシーン構造はセマンティックレイアウト生成によってモデル化され、ローカルな詳細は条件付き画像生成によってモデル化される、分離可能な表現を学習すること。
  • 合成されたセグメンテーションマップを追加の訓練データとして用いることで、既存のセマンティック画像生成モデルの性能を向上させること。

提案手法

  • モデルは二段階のパイプラインを用いる:まず、無条件のプログレッシブなセグメンテーション生成ネットワークがランダムノイズから現実的なピクセル単位のセマンティックラベルマップを合成する。
  • 第二に、合成されたセマンティックレイアウトを条件として、写真のようにリアルな画像を生成する条件付きのセグメンテーションから画像への合成ネットワークを用いる。
  • セグメンテーション生成器は、現実的な外観のレイアウトを生成するように adversarial ディスクラミネーターで訓練され、画像生成器は条件付きおよび無条件のディスクラミネーターの両方で訓練され、リアルさと一貫性を確保する。
  • エンドツーエンドの訓練により、両方のコンponentが同時に最適化され、セグメンテーション生成器が、高品質な画像合成に適した意味的に整合性のあるレイアウトを生成できるようにする。
  • 学習の安定化とサンプル品質の向上を図るため、プログレッシブトレーニングと複数のディスクラミネーターを用いた adversarial テクニックをモデルが活用する。
  • 訓練中に生成された合成セグメンテーションマップは、SPADEなどの最先端の条件付きモデルのファインチューニングに再利用され、真の真値ラベルでの性能向上が達成された。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、グローバルな構造的整合性とローカルなリアリズムを維持しながら、無条件で複雑で高解像度のシーンを合成できるか?
  • RQ2GANによって生成されたセマンティックレイアウトは、高精細な画像生成のための意味的で現実的なボトルネックとして機能できるか?
  • RQ3セグメンテーション生成器と画像生成器をエンドツーエンドで訓練することは、個別に訓練するのと比べて性能を向上させられるか?
  • RQ4このモデルが生成する合成セグメンテーションマップを訓練データとして用いることで、既存のセマンティック画像生成ネットワークの性能向上が達成できるか?

主な発見

  • SB-GANは、Cityscapes-5k(FID 58.67)およびCityscapes-25k(FID 54.13)で最先端のFIDスコアを達成し、無条件画像生成においてProGANおよびBigGANを上回った。
  • ADE-Indoorデータセットでは、SB-GANはFID 48.15を達成し、ベースラインのSPADEモデルを顕著に上回った。
  • Mechanical Turkを用いたユーザースタディーでは、SB-GANはCityscapes-25kで平均品質スコア2.61、ADE-Indoorで2.49を記録し、ProGANおよびBigGANを上回った。
  • SB-GANの条件付き画像生成サブネットワークを合成ラベルでファインチューニングすると、初期学習から開始する場合と比べてFIDスコアが5.0%改善された。
  • アブレーションスタディーでは、完全なエンドツーエンドファインチューニングが最良のパフォーマンス(FID 58.67)を示し、ジョイントファインチューニングがコンponentごとのファインチューニングを上回った。
  • SB-GANが生成する合成セグメンテーションマップを用いてSOTAのSPADEモデルをファインチューニングすることで、性能が向上した。これは、セマンティック画像生成におけるデータ拡張としてのその有用性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。