Skip to main content
QUICK REVIEW

[论文解读] Semi-parametric Image Synthesis

Xiaojuan Qi, Qifeng Chen|arXiv (Cornell University)|Apr 29, 2018
Generative Adversarial Networks and Image Synthesis参考文献 33被引用 11
一句话总结

本文提出半参数化图像合成(SIMS),一种结合深度参数化网络与真实图像片段非参数记忆库的方法,能够从语义布局生成更具真实感的摄影级图像。通过基于布局兼容性检索并组合真实世界图像片段,并利用深度网络进行对齐与优化,SIMS相较于纯参数化方法在真实感与感知质量方面均有显著提升。

ABSTRACT

We present a semi-parametric approach to photographic image synthesis from semantic layouts. The approach combines the complementary strengths of parametric and nonparametric techniques. The nonparametric component is a memory bank of image segments constructed from a training set of images. Given a novel semantic layout at test time, the memory bank is used to retrieve photographic references that are provided as source material to a deep network. The synthesis is performed by a deep network that draws on the provided photographic material. Experiments on multiple semantic segmentation datasets show that the presented approach yields considerably more realistic images than recent purely parametric techniques. The results are shown in the supplementary video at https://youtu.be/U4Q98lenGLQ

研究动机与目标

  • 解决纯参数化图像合成模型的局限性,即在推理阶段无法访问真实摄影数据,常导致输出不够真实。
  • 将非参数方法的优势——使用真实图像参考——重新整合进现代深度学习图像合成流水线。
  • 开发一种半参数化框架,利用外部图像片段记忆库实现真实感图像生成,同时保持深度网络的灵活性与表达能力。
  • 通过与真实世界图像统计特性对齐,提升合成图像的感知真实感与统计一致性。

提出的方法

  • 从真实照片训练集中构建图像片段的记忆库,每个片段均关联其语义布局。
  • 在推理阶段,给定一个新的语义布局,通过学习到的相似性度量从记忆库中检索兼容的片段。
  • 一个变换网络将检索到的片段对齐至空间布局,解决遮挡问题并调整尺度与方向。
  • 一个排序网络确定片段的正确叠加顺序,以确保空间一致性与合理的场景构图。
  • 一个深度生成网络处理拼合后的画布,生成最终的逼真图像,优化纹理并融合边缘。
  • 整个流水线采用端到端方式进行训练,推理阶段记忆库保持固定。

实验结果

研究问题

  • RQ1将真实图像片段的非参数化检索与参数化深度网络结合,能否提升从语义布局生成图像的真实感?
  • RQ2在推理阶段使用真实摄影样本是否能显著提升感知质量,相较于纯参数化模型?
  • RQ3合成图像的统计特性(如功率谱)在多大程度上能与真实图像匹配?
  • RQ4通过为同一输入布局检索不同的片段,该方法能否生成多样化且高质量的输出?

主要发现

  • 人类偏好实验确认,SIMS生成的图像在感知真实感方面显著优于当前最先进的参数化方法(如Pix2pix和CRN)。
  • 在ADE20K数据集上,SIMS生成图像的平均功率谱几乎与真实图像无法区分,而Pix2pix和CRN则表现出虚假的谱峰。
  • 在限时成对比较中,SIMS在Cityscapes-coarse(50.2%)和Cityscapes-fine(50.5%)数据集上的偏好率超过真实图像,表明其真实感已接近人类水平。
  • 该方法保持了高度的语义一致性,使用预训练的PSPNet评估时,各类数据集上的IoU分数接近真实图像。
  • 该方法对领域偏移具有鲁棒性,在从Cityscapes迁移至GTA5时仍能生成高质量图像。
  • 通过采样不同的top-k检索片段,SIMS可为同一布局生成多样化输出,实现多种逼真的图像变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。