Skip to main content
QUICK REVIEW

[論文レビュー] Image Generation from Layout

Bo Zhao, Lili Meng|arXiv (Cornell University)|Nov 28, 2018
Generative Adversarial Networks and Image Synthesis参考文献 57被引用数 7
ひとこと要約

この論文は、オブジェクトのカテゴリとバウンディングボックスで定義された粗いレイアウトから、多様で現実的な画像を生成する、新しい深層生成モデルであるLayout2Imを提案する。オブジェクト表現をカテゴリ(単語埋め込みを用いて)と外見(正規分布からサンプリングされた潜在ベクトルを用いて)に分離し、畳み込みLSTMを介して合成することで、COCO-Stuffでは24.66%、Visual Genomeでは28.57%の向上を達成する最先端のインceptionスコアを実現した。同時に、セグメンテーションマスクを必要とせず、制御可能で多様な画像生成が可能である。

ABSTRACT

Despite significant recent progress on generative models, controlled generation of images depicting multiple and complex object layouts is still a difficult problem. Among the core challenges are the diversity of appearance a given object may possess and, as a result, exponential set of images consistent with a specified layout. To address these challenges, we propose a novel approach for layout-based image generation; we call it Layout2Im. Given the coarse spatial layout (bounding boxes + object categories), our model can generate a set of realistic images which have the correct objects in the desired locations. The representation of each object is disentangled into a specified/certain part (category) and an unspecified/uncertain part (appearance). The category is encoded using a word embedding and the appearance is distilled into a low-dimensional vector sampled from a normal distribution. Individual object representations are composed together using convolutional LSTM, to obtain an encoding of the complete layout, and then decoded to an image. Several loss terms are introduced to encourage accurate and diverse generation. The proposed Layout2Im model significantly outperforms the previous state of the art, boosting the best reported inception score by 24.66% and 28.57% on the very challenging COCO-Stuff and Visual Genome datasets, respectively. Extensive experiments also demonstrate our method's ability to generate complex and diverse images with multiple objects.

研究の動機と目的

  • 粗いレイアウト(バウンディングボックス+カテゴリ)から多様で現実的な画像を生成する課題に取り組むこと。これは、外見や相互作用のばらつきがあるため、1対多の問題である。
  • 複雑なシーンを扱いにくく、空間的制御ができないテキストから画像への生成法の限界を克服すること。
  • オブジェクトの位置とサイズを明確に指定する、よりアクセスしやすく正確なレイアウト入力を用いることで、シーングラフベースの手法を改善すること。
  • オブジェクトの追加・移動・削除などのレイアウト要因の簡単な操作を可能にすることで、制御可能な画像生成を実現すること。
  • 画像の現実性、多様性、オブジェクトの識別可能性をバランスさせる、微分可能でエンドツーエンドで学習可能なフレームワークを開発すること。

提案手法

  • 各オブジェクトの表現をカテゴリ(学習済みの単語埋め込みによって符号化)と外見(正規分布からサンプリングされた低次元の潜在ベクトルによって表現)に分離する。
  • バウンディングボックスの座標とそれに対応する表現を用いて、オブジェクト固有の特徴マップを構築する。
  • 空間的および文脈的依存関係をモデル化するために、畳み込みLSTMを用いてすべてのオブジェクトの特徴マップを統合し、グローバルな画像表現を生成する。
  • デコンボリューションネットワークを用いて、グローバルな特徴マップを最終的な画像にデコードする。
  • ピクセル単位のL1再構成損失、画像およびオブジェクトレベルの出力における adversarial 損失、生成されたオブジェクトのカテゴリ分類損失を含むマルチコンponent損失でモデルを訓練する。
  • 2つのディスクライマーを用いる:1つは全画像(現実性を強制)を、もう1つは切り出しられたオブジェクト領域(現実的でかつ正しいカテゴリのオブジェクト生成を保証)を対象とする。

実験結果

リサーチクエスチョン

  • RQ1セグメンテーションマスクや複雑なシーングラフを必要とせず、オブジェクトのカテゴリとバウンディングボックスから粗いレイアウトをもとに、多様で現実的な画像を生成できる深層生成モデルは存在するか?
  • RQ2同じレイアウトから制御可能で多様な画像生成を可能にするために、オブジェクトの外見とカテゴリをどのように分離すればよいか?
  • RQ3レイアウトベースの画像合成において、画像の現実性、オブジェクトの識別可能性、生成の多様性をバランスさせるために必要な損失成分は何か?
  • RQ4COCO-Stuff や Visual Genome といった複雑な実世界データセットにおいて、レイアウトベースの生成法は、従来のテキストから画像への生成法やシーングラフから画像への生成法をどの程度上回るか?
  • RQ5アドバーシャル損失や再構成損失などの主要な構成要素を除去した場合、モデルの性能はどのように変化するか?

主な発見

  • 提案されたLayout2Imモデルは、COCO-Stuffデータセットにおいて、以前の最先端手法比で24.66%のインセプションスコア向上を達成した。
  • より困難なVisual Genomeデータセットでは、28.57%のインセプションスコア向上を示し、複雑でオープンボキャブラリーなシーンにおいて優れた性能を発揮した。
  • Visual Genomeデータセットでは、多様性スコアが0.17に達し、sg2imベースラインの0.02よりも顕著に高く、強力な生成多様性を示した。
  • アブレーションスタディの結果、L1再構成損失や潜在コード損失を除去するとインセプションスコアが低下し、画像の現実性に寄与することが示された。
  • オブジェクト分類損失を除去すると、インセプションスコアとオブジェクト正答率が急激に低下(10.06%)し、識別可能なオブジェクトを生成する役割を果たしていることが確認された。
  • 完全なモデルは、インセプションスコア(8.1 ± 0.1)、オブジェクト分類正答率(48.09%)、多様性スコア(0.17)のすべての指標で、アブレーションバージョンを上回るバランスの取れた性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。