Skip to main content
QUICK REVIEW

[論文レビュー] Using Scene Graph Context to Improve Image Generation

Subarna Tripathi, Anahita Bhiwandiwalla|arXiv (Cornell University)|Jan 11, 2019
Multimodal Machine Learning Applications参考文献 23被引用数 20
ひとこと要約

本論文は、生成器および識別器の両方にプールされたグラフ特徴を注入することで、シーングラフからの画像生成を向上させるシーングラフコンテキストネットワークを提案する。この手法により、意味的および非空間的関係に対する適合性が向上し、Visual GenomeおよびCOCO-stuffで最先端の性能を達成する。関係性の平均意見スコア(MORS)は0.74であり、先行研究の0.64を上回り、生成画像におけるシーングラフ関係の整合性が優れていることを示している。

ABSTRACT

Generating realistic images from scene graphs asks neural networks to be able to reason about object relationships and compositionality. As a relatively new task, how to properly ensure the generated images comply with scene graphs or how to measure task performance remains an open question. In this paper, we propose to harness scene graph context to improve image generation from scene graphs. We introduce a scene graph context network that pools features generated by a graph convolutional neural network that are then provided to both the image generation network and the adversarial loss. With the context network, our model is trained to not only generate realistic looking images, but also to better preserve non-spatial object relationships. We also define two novel evaluation metrics, the relation score and the mean opinion relation score, for this task that directly evaluate scene graph compliance. We use both quantitative and qualitative studies to demonstrate that our pro-posed model outperforms the state-of-the-art on this challenging task.

研究の動機と目的

  • オブジェクト関係、特に非空間的関係に対する適合性を向上させることで、シーングラフからの画像生成を改善すること。
  • 画像生成におけるシーングラフ適合性のためのタスク特化型評価指標の欠如に対処すること。
  • 生成器および識別器にシーングラフの意味を統合するコンテキストに配慮したトレーニングフレームワークを構築すること。
  • シーングラフコンテキストを組み込むことで、より現実的で構造的に正確な画像が得られることを実証すること。

提案手法

  • シーングラフコンテキストネットワークは、グラフ畳み込みネットワーク(GCN)からの特徴をプールして、生成器および識別器のためのコンテキスト埋め込みを生成する。
  • これらのコンテキスト埋め込みを生成器および識別器に注入することで、シーングラフ関係を尊重する画像生成を促進する。
  • コンテキストに配慮した adversarial 損失を適用し、両ネットワークをプールされたシーングラフコンテキストで条件づけることで、リアルさと構造的正確性を向上させる。
  • 本モデルは、予測されたオブジェクトレイアウトとシーンコンテキストから高解像度画像を生成するためのカスケードリファインメントネットワークを用いる。
  • レイアウト生成段階および画像生成段階での適合性を測定するための新規評価指標として、関係スコアおよび平均意見関係スコア(MORS)を導入する。
  • 本フレームワークは、Visual GenomeおよびCOCO-stuffデータセットでトレーニングおよび評価され、MORSの妥当性をユーザー研究で検証した。

実験結果

リサーチクエスチョン

  • RQ1生成器および識別器の両方にシーングラフコンテキストを注入することで、画像生成の忠実性および関係適合性が向上するか?
  • RQ2本手法は、意味的および所有関係などの非空間的関係を、先行研究と比較してどの程度うまく保存できるか?
  • RQ3新規指標としての関係スコアおよびMORSは、従来のピクセルベース指標と比較して、シーングラフ適合性をどの程度よく捉えているか?
  • RQ4シーンコンテキストネットワークは、複雑またはごみだらけのシーンにおいて、レイアウト予測の正確性および最終的な画像のリアルさを向上させるか?
  • RQ5本手法の評価フレームワークは、ユーザー研究において、グラフ条件付き画像生成の品質を信頼性高く測定できるか?

主な発見

  • 提案モデルは、Visual Genomeテストセットで平均意見関係スコア(MORS)0.74を達成し、Johnsonら[9]の0.64を顕著に上回った。
  • 意味的関係に関しては、関係スコア0.78を達成したのに対し、ベースラインは0.60であった。これは適合性の大幅な向上を示している。
  • 所有関係に関しては、関係スコアが0.80に達したのに対し、ベースラインは0.62であった。これは、複雑な関係的概念においても優れた性能を示している。
  • 本モデルは、ベースラインの0.223と比較して、交差率(IoU)0.234を示し、レイアウト予測の正確性が向上していることを示している。
  • 定性的な結果から、シーンコンテキストが、非空間的関係を含む多様な関係タイプを複数のテストセットで保持するのに役立つことがわかった。
  • ユーザー研究の結果、生成画像がシーングラフとより整合的であることが確認され、特に意味的および所有関係において、MORSが知覚的指標として有効であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。