Skip to main content
QUICK REVIEW

[論文レビュー] Diverse Image Synthesis from Semantic Layouts via Conditional IMLE

Ke Li, Tianhao Zhang|arXiv (Cornell University)|Nov 29, 2018
Generative Adversarial Networks and Image Synthesis参考文献 42被引用数 7
ひとこと要約

本論文では、意味的レイアウトから多様な画像を合成するための条件付きIMLEベースの手法を提案する。1つのレイアウトに対して任意の数の画像生成が可能であり、モード崩壊を回避する。単一のニューラルネットワークとノイズベクトルのサンプリングを活用することで、CRNなどの先行SOTA手法よりも高い多様性とより少ないアーティファクトを達成。教師なしで意味的に構造的な潜在空間を学習可能である。

ABSTRACT

Most existing methods for conditional image synthesis are only able to generate a single plausible image for any given input, or at best a fixed number of plausible images. In this paper, we focus on the problem of generating images from semantic segmentation maps and present a simple new method that can generate an arbitrary number of images with diverse appearance for the same semantic layout. Unlike most existing approaches which adopt the GAN framework, our method is based on the recently introduced Implicit Maximum Likelihood Estimation (IMLE) framework. Compared to the leading approach, our method is able to generate more diverse images while producing fewer artifacts despite using the same architecture. The learned latent space also has sensible structure despite the lack of supervision that encourages such behaviour. Videos and code are available at https://people.eecs.berkeley.edu/~ke.li/projects/imle/scene_layouts/.

研究の動機と目的

  • 入力レイアウトごとに1枚または固定数の画像しか生成できない既存の条件付き画像合成手法の制限を解消すること。
  • 同じ意味的レイアウトから、モード崩壊を回避して任意の数の多様で高品質な画像を生成できること。
  • 明示的な教師信号なしで、分離可能で意味的に意味のある潜在空間をノイズベクトルに対して学習すること。
  • GANベースやマルチジェネレータアプローチと比較して、訓練の安定性を向上させ、アーティファクトを低減すること。

提案手法

  • 訓練中にモード崩壊を回避するため、GANフレームワークではなく、暗黙的最尤推定(IMLE)を採用する。
  • 意味的レイアウトとランダムなノイズベクトルを入力として受け取り、多様な画像を生成する単一の順方向畳み込みニューラルネットワークを用いる。
  • 画像の質と多様性を最適化するために、事前学習済みVGGネットワークの特徴表現に基づく知覚的損失を用いてモデルを訓練する。
  • ノイズ分布をより構造的に学習することで多様性を向上させるノイズエンコーダを導入。同時に、再バランス化スキームにより訓練の安定性を向上。
  • 潜在空間の補間を用いて意味的連続性を評価し、生成画像間で滑らかで知覚的に整合性のある遷移を示した。
  • 異なる意味的レイアウトに同じノイズベクトルを適用することで、シーン編集時のスタイルの一貫性を確保。

実験結果

リサーチクエスチョン

  • RQ1GANでないフレームワークは、1つの意味的レイアウトからモード崩壊を回避して多様で高品質な画像を生成できるか?
  • RQ2単一のニューラルネットワークが、単に異なるノイズベクトルをサンプリングするだけで、任意の数の多様な画像を生成できるか?
  • RQ3明示的な教師信号なしで、学習された潜在空間が意味的に意味のある構造を示すか?
  • RQ4CRN や BicycleGAN などの最先端ベースラインと比較して、本手法は多様性とアーティファクト低減の点で優れているか?
  • RQ5同じノイズベクトルを異なる意味的レイアウトに適用した場合、モデルは一貫したスタイルを維持できるか?

主な発見

  • 本手法は、すべてのモデルおよびアブレーションの中で最高のLPIPSスコア(0.19)を達成し、生成画像の多様性が最も高いことを示した。
  • 人間評価では、本手法が生成した画像のうち36.4%しか顕著な合成パターンを示さなかったが、CRNの63.6%と比べて顕著に低い水準であった。
  • アブレーションスタディにより、ノイズエンコーダと再バランス化スキームの両方が不可欠であることが確認された。両方を削除すると、アーティファクト率が上昇し、多様性が低下した。
  • 昼間と夜間のシーンにおけるノイズベクトル間の線形補間により、滑らかで知覚的に整合性のある遷移が得られ、意味的に構造的な潜在空間であることを示した。
  • 異なる意味的レイアウトに同じノイズベクトルを適用することで、スタイルの一貫性が維持され、一貫した視覚的スタイルを有する効果的なシーン編集が可能となった。
  • CRNと同一のアーキテクチャを用いても、本手法はより少ないアーティファクトとより高い多様性を生成した。これは、IMLEフレームワークの優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。