Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Transformers for Scene Generation

Drew A. Hudson, C. Lawrence Zitnick|arXiv (Cornell University)|Nov 17, 2021
Generative Adversarial Networks and Image Synthesis参考文献 74被引用数 11
ひとこと要約

GANformer2 は、構成的シーン生成のための2段階的、オブジェクト指向型トランスフォーマーを提案する。まず段階的オブジェクトレベルの最適化により高レベルのレイアウトを計画し、次に二部グラフアテンションを用いてフォトリッチな画像を生成する。CLEVRおよびCOCOで、画像品質、多様性、意味的整合性において最先端の性能を達成し、明示的な構造的事前知識により分離性と解釈可能性が向上している。

ABSTRACT

We introduce the GANformer2 model, an iterative object-oriented transformer, explored for the task of generative modeling. The network incorporates strong and explicit structural priors, to reflect the compositional nature of visual scenes, and synthesizes images through a sequential process. It operates in two stages: a fast and lightweight planning phase, where we draft a high-level scene layout, followed by an attention-based execution phase, where the layout is being refined, evolving into a rich and detailed picture. Our model moves away from conventional black-box GAN architectures that feature a flat and monolithic latent space towards a transparent design that encourages efficiency, controllability and interpretability. We demonstrate GANformer2's strengths and qualities through a careful evaluation over a range of datasets, from multi-object CLEVR scenes to the challenging COCO images, showing it successfully achieves state-of-the-art performance in terms of visual quality, diversity and consistency. Further experiments demonstrate the model's disentanglement and provide a deeper insight into its generative process, as it proceeds step-by-step from a rough initial sketch, to a detailed layout that accounts for objects' depths and dependencies, and up to the final high-resolution depiction of vibrant and intricate real-world scenes. See https://github.com/dorarad/gansformer for model implementation.

研究の動機と目的

  • 従来の GAN が複雑で多数のオブジェクトを含むシーンをモデル化する際の制御性と解釈可能性の低さという限界を解消すること。
  • オブジェクトとその空間的・意味的・関係的依存関係を明示的にモデル化することで、構造的で階層的な画像生成を可能にすること。
  • 構造(レイアウト)とスタイル(外観)を分離し、透明で段階的なプロセスにより分離性と制御性を向上させること。
  • 合成および現実世界の両方のデータセットにおいて、忠実度、多様性、整合性の観点で最先端の性能を示すこと。
  • 真値アノテーションの代わりに自動予測されたパノプティックセグメンテーションを用いて学習することで、モデルの頑健性を検証すること。

提案手法

  • モデルは、各オブジェクトまたはエンティティを表す学習可能な潜在変数の集合を用い、それらに構造とスタイルが関連付けられる。
  • 計画段階では、オブジェクト潜在変数に注目し、空間的位置、形状、相対順序を段階的に最適化することで高レベルのシーンレイアウトを構築する。
  • 実行段階では、レイアウトが二部グラフアテンションを用いてフォトリッチな画像に精錬され、各潜在変数が対応するセグメントのコンテンツとスタイルをガイドする。
  • 生成器は非飽和 GAN 損失とラージ R1 正則化を用い、等価学習率と指数移動平均を用いた Adam 最適化手法で訓練される。
  • 識別器は構造的損失を強化し、構成的忠実度を促進する。また、StyleGAN2 の技術を活用し、スタイルミキシングとミニバッチ標準偏差を用いる。
  • 勾配蓄積を用い、$256 \times 256$ の画像で学習を行い、潜在次元と R1 要因を安定性と性能の最適化のために調整する。

実験結果

リサーチクエスチョン

  • RQ1明示的なオブジェクトレベル潜在変数を備えた2段階的トランスフォーマーに基づく生成器は、標準的な GAN よりも複雑で多数のオブジェクトを含むシーンの生成において優れているか?
  • RQ2段階的計画と実行プロセスは、構造とスタイルの分離性をどの程度向上させるか?
  • RQ3自動予測セグメンテーションを用いて学習した場合、COCO のような困難で多様なデータセットへの一般化性能はどの程度か?
  • RQ4遮蔽されたオブジェクトの模索的完成(amodal completion)を示すことは、シーン構成に関する推論を内蔵していると示唆するか?
  • RQ5忠実度、多様性、整合性の観点で、非条件付きおよび条件付き画像生成の両方において最先端の性能を達成できるか?

主な発見

  • GANformer2 は、CLEVR および COCO データセットの両方で最先端の FID スコアを達成し、StyleGAN2 や GANformer を含むベースラインと比較して優れた画像品質と多様性を示している。
  • モデルは高い意味的整合性を示し、視覚的多様性とは独立して構成的複雑性が強い COCO p パartition に対しても高品質な生成が可能である。
  • アブレーションスタディにより、2段階設計が分離性を顕著に向上させ、オブジェクトの位置と属性を独立して操作可能であることが確認された。
  • 遮蔽されたオブジェクトの模索的完成を示すことで、オブジェクトの幾何学的およびシーン構造に関する暗黙の推論が行われていると示唆される。
  • 真値アノテーションに依存しない自動予測セグメンテーションを用いた学習でも優れた性能を示し、高価な真値アノテーションへの依存を低減する頑健性が裏付けられた。
  • 実行段階では、Pix2PixHD や SPADE などの強力な条件付きモデルと同等またはそれを上回る性能を示し、詳細で整合性のあるシーンの生成に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。