Skip to main content
QUICK REVIEW

[论文解读] Using Scene Graph Context to Improve Image Generation

Subarna Tripathi, Anahita Bhiwandiwalla|arXiv (Cornell University)|Jan 11, 2019
Multimodal Machine Learning Applications参考文献 23被引用 20
一句话总结

本文提出了一种场景图上下文网络,通过将池化的图特征注入生成器和判别器网络,提升图像生成对语义关系和非空间关系的符合度。该方法在 Visual Genome 和 COCO-stuff 数据集上达到最先进性能,平均意见关系得分(MORS)为 0.74,优于先前工作的 0.64,表明生成图像与场景图关系的对齐程度显著提升。

ABSTRACT

Generating realistic images from scene graphs asks neural networks to be able to reason about object relationships and compositionality. As a relatively new task, how to properly ensure the generated images comply with scene graphs or how to measure task performance remains an open question. In this paper, we propose to harness scene graph context to improve image generation from scene graphs. We introduce a scene graph context network that pools features generated by a graph convolutional neural network that are then provided to both the image generation network and the adversarial loss. With the context network, our model is trained to not only generate realistic looking images, but also to better preserve non-spatial object relationships. We also define two novel evaluation metrics, the relation score and the mean opinion relation score, for this task that directly evaluate scene graph compliance. We use both quantitative and qualitative studies to demonstrate that our pro-posed model outperforms the state-of-the-art on this challenging task.

研究动机与目标

  • 通过增强模型对物体关系(尤其是非空间关系)的符合度,提升从场景图生成图像的性能。
  • 解决图像生成任务中缺乏针对场景图符合度的特定评估指标的问题。
  • 开发一种上下文感知的训练框架,将场景图语义信息整合到生成器和判别器中,实现更优的对齐效果。
  • 证明引入场景图上下文可生成更真实且结构更准确的图像。

提出的方法

  • 一种场景图上下文网络通过图卷积网络(GCN)池化特征,为生成器和判别器生成上下文嵌入。
  • 将上下文嵌入注入生成器和判别器,以鼓励生成尊重场景图关系的图像。
  • 应用上下文感知的对抗性损失,使两个网络均基于池化的场景图上下文进行条件化,以提升真实感和结构保真度。
  • 模型使用级联细化网络,从预测的物体布局和场景上下文中生成高分辨率图像。
  • 引入新颖的评估指标——关系得分和平均意见关系得分(MORS),用于衡量布局阶段和图像生成阶段的关系符合度。
  • 该框架在 Visual Genome 和 COCO-stuff 数据集上进行训练和评估,并通过用户研究验证 MORS 的有效性。

实验结果

研究问题

  • RQ1将场景图上下文同时注入生成器和判别器,是否能提升图像生成的保真度和关系符合度?
  • RQ2与先前工作相比,该方法在保留非空间关系(如语义关系和所有格关系)方面表现如何?
  • RQ3新颖指标——关系得分和 MORS——在捕捉场景图符合度方面,相较于传统基于像素的指标,优势有多大?
  • RQ4场景上下文网络是否能提升复杂或杂乱场景中的布局预测准确度和最终图像的真实感?
  • RQ5所提出的评估框架是否能在用户研究中可靠地衡量图条件化图像生成的质量?

主要发现

  • 所提模型在 Visual Genome 测试集上达到 0.74 的平均意见关系得分(MORS),显著优于 Johnson 等人 [9] 的 0.64。
  • 对于语义关系,模型的关系得分为 0.78,高于基线的 0.60,表明在关系符合度方面有显著提升。
  • 对于所有格关系,关系得分达到 0.80,高于基线的 0.62,表明在复杂关系概念上表现优异。
  • 模型的交并比(IoU)提升至 0.234,优于基线的 0.223,表明布局预测准确度更高。
  • 定性结果表明,场景上下文有助于在多个测试集上保持多样化的关系类型,包括非空间关系。
  • 用户研究证实,生成图像与场景图的一致性更高,尤其在语义关系和所有格关系方面,验证了 MORS 作为感知指标的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。