Skip to main content
QUICK REVIEW

[論文レビュー] Diffusion-Based Scene Graph to Image Generation with Masked Contrastive Pre-Training

L. Yang, Zhilin Huang|arXiv (Cornell University)|Nov 21, 2022
Generative Adversarial Networks and Image Synthesis被引用数 10
ひとこと要約

本稿では、マスク付き自己符号化と対照学習を用いた事前学習により、画像生成とシーングラフの整合性を向上させる拡散ベースの画像生成モデルSGDiffを提案する。本手法はVisual GenomeおよびCOCO-Stuffで最先端の性能を達成し、256×256画像生成においてInception Score(16.4)とFID(26.0)のSOTA結果を記録するとともに、シーングラフの編集による意味的制御が可能である。

ABSTRACT

Generating images from graph-structured inputs, such as scene graphs, is uniquely challenging due to the difficulty of aligning nodes and connections in graphs with objects and their relations in images. Most existing methods address this challenge by using scene layouts, which are image-like representations of scene graphs designed to capture the coarse structures of scene images. Because scene layouts are manually crafted, the alignment with images may not be fully optimized, causing suboptimal compliance between the generated images and the original scene graphs. To tackle this issue, we propose to learn scene graph embeddings by directly optimizing their alignment with images. Specifically, we pre-train an encoder to extract both global and local information from scene graphs that are predictive of the corresponding images, relying on two loss functions: masked autoencoding loss and contrastive loss. The former trains embeddings by reconstructing randomly masked image regions, while the latter trains embeddings to discriminate between compliant and non-compliant images according to the scene graph. Given these embeddings, we build a latent diffusion model to generate images from scene graphs. The resulting method, called SGDiff, allows for the semantic manipulation of generated images by modifying scene graph nodes and connections. On the Visual Genome and COCO-Stuff datasets, we demonstrate that SGDiff outperforms state-of-the-art methods, as measured by both the Inception Score and Fréchet Inception Distance (FID) metrics. We will release our source code and trained models at https://github.com/YangLing0818/SGDiff.

研究の動機と目的

  • シーンレイアウトなどの手作業で設計された中間表現による、シーングラフと生成画像の間の整合性の欠如を是正すること。
  • 対応する画像との整合性を明示的に最適化するシーングラフ埋め込みを学習し、生成の正確性と構造的整合性を向上させること。
  • シーングラフの編集によって意味的画像操作を可能にするために、分離可能で予測可能な埋め込みを学習すること。
  • エンドツーエンドで学習された埋め込みが、定量的および定性的な画像生成ベンチマークにおいて、手作業で設計されたシーンレイアウト表現を上回ることを示すこと。

提案手法

  • マスクされていない領域とグラフ埋め込みに基づいて、欠落した画像領域を再構築するように、マスク付き自己符号化損失を用いてシーングラフエンコーダーを事前学習する。
  • 画像-グラフペアがシーングラフに従っているか否かを区別するように対照学習を適用し、グローバルな構造的整合性を強化する。
  • 局所的(マスク付き自己符号化)およびグローバル(対照的)な埋め込みを統合し、予測性能を向上させる統一された表現を構築する。
  • 事前学習済みのシーングラフ埋め込みを条件として用い、高精細で構造的に正確な画像を生成する潜在拡散モデルを構築する。
  • 学習された埋め込みを用いて、シーングラフ内のノードや関係を変更することで意味的画像操作を可能にする。
  • ISおよびFID指標を用いて、Visual GenomeおよびCOCO-Stuffデータセット上でモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1マスク付き対照的事前学習によるシーングラフ埋め込みが、入力のシーングラフとの整合性および画像生成品質を向上させることができるか?
  • RQ2局所的(マスク付き自己符号化)およびグローバル(対照的)な埋め込み部成分は、画像生成性能にどのように異なる寄与をしているか?
  • RQ3エンドツーエンドで学習されたシーングラフ埋め込みは、シーングラフから画像への生成において、手作業で設計されたシーンレイアウト表現を上回るか?
  • RQ4学習された埋め込みは、シーングラフの編集によって、細粒度の意味的画像操作を可能にするか?

主な発見

  • マスク付き自己符号化と対照学習の組み合わせにより、グラフから画像への検索で73.4%、画像からグラフへの検索で74.1%の精度を達成し、個別の損失よりも優れた性能を示した。
  • SGDiffはCOCO-StuffデータセットでInception Score 16.4 ± 0.6およびFID 26.0を達成し、ワンホット表現(IS: 10.1, FID: 87.1)およびレイアウトベースのベースライン(IS: 12.3, FID: 52.7)を上回った。
  • マスク付き事前学習は局所的構造の生成を向上させ、より細かいオブジェクトのディテールを持つ画像を生成した。一方、対照学習はグローバルな構造的整合性を向上させた。
  • アブレーションスタディの結果、マスク付き自己符号化損失と対照損失の両方が不可欠であり、組み合わせが最良の性能をもたらした。
  • 定性的な結果から、SGDiffは従来手法と比較して、特に「食べる」や「見つめている」などの複雑な関係において、より現実的でグラフに整合した画像を生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。