Skip to main content
QUICK REVIEW

[论文解读] Learning Neurosymbolic Generative Models via Program Synthesis

Halley Young, Osbert Bastani|arXiv (Cornell University)|Jan 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 5
一句话总结

本文提出程序合成引导的生成模型(PS-GM),通过整合神经符号程序(包含感知组件的草图)来捕捉图像中的全局结构模式,例如重复的窗户排列。通过从训练数据中合成程序并利用其指导深度生成模型,PS-GM 在图像生成与补全任务上显著优于当前最先进基线模型,尤其在具有复杂空间结构的数据上表现突出。

ABSTRACT

Significant strides have been made toward designing better generative models in recent years. Despite this progress, however, state-of-the-art approaches are still largely unable to capture complex global structure in data. For example, images of buildings typically contain spatial patterns such as windows repeating at regular intervals; state-of-the-art generative methods can't easily reproduce these structures. We propose to address this problem by incorporating programs representing global structure into the generative model---e.g., a 2D for-loop may represent a configuration of windows. Furthermore, we propose a framework for learning these models by leveraging program synthesis to generate training data. On both synthetic and real-world data, we demonstrate that our approach is substantially better than the state-of-the-art at both generating and completing images that contain global structure.

研究动机与目标

  • 解决当前最先进深度生成模型在捕捉图像中复杂全局结构(如重复模式)方面的局限性。
  • 开发一种将程序合成与深度生成模型结合的方法,以在感知数据中建模高层级结构先验。
  • 通过利用合成程序作为结构先验,实现从零开始的图像生成与图像补全。
  • 通过使用领域特定的程序合成技术生成监督信号,克服训练数据中缺乏真实全局结构的挑战。
  • 证明引入程序化结构可提升图像生成与补全的准确性与结构化程度,尤其在低数据场景下。

提出的方法

  • 将全局结构分解为带孔洞的草图(s)与感知组件(c),构成神经符号程序 P = (s, c)。
  • 使用领域特定的程序合成算法,从训练图像中提取表示二维重复模式的嵌套 for 循环。
  • 通过在输入数据的感知组件上执行合成程序 P,生成结构化渲染结果 x_struct。
  • 训练深度生成模型(如 VAE、GAN 或 VED),利用结构先验引导将 x_struct 完成为完整图像。
  • 在图像补全任务中,从部分图像中合成程序,外推预测完整结构,并利用预训练模型引导补全过程。
  • 使用从合成程序中衍生的监督信号端到端训练系统,避免使用强化学习或弱监督。

实验结果

研究问题

  • RQ1神经符号程序能否有效捕捉图像中复杂的全局结构,如二维重复模式?
  • RQ2通过程序合成引入程序化结构,是否能提升深度生成模型在图像生成与补全任务中的性能?
  • RQ3在结构保真度与定量指标方面,所提出的 PS-GM 框架与 GLCIC、CycleGAN 和 VAE 等当前最先进模型相比表现如何?
  • RQ4该方法能否在真实世界数据集(如 facades 数据集)上实现泛化,尤其在数据有限时,而基线模型表现失败?
  • RQ5在低数据场景下,使用合成程序作为结构先验在提升泛化能力与样本质量方面有多大改善?

主要发现

  • 在合成数据上,PS-GM 的 Fréchet inception distance(FID)达到 91.8(CycleGAN)与 106.8(GLCIC),显著优于基线模型(分别为 218.7 和 163.66)。
  • 在 facades 数据集上,PS-GM 将 FID 降低至 124.4(CycleGAN)与 141.8(GLCIC),相比基线值 251.4 与 195.9,展现出对数据稀缺的强鲁棒性。
  • 在基于 VED 的补全任务中,PS-GM 在 facades 数据集上取得负对数似然(NLL)为 8755.4,略优于基线的 8636.3,尽管两者均因结构学习能力差而表现不佳。
  • 在图像生成任务中,PS-GM 搭配 VED 生成的图像在结构一致性与模式组织性方面优于基线 VAE,如定性比较所示。
  • PS-GM 框架在具有复杂空间结构(如具有重复窗户图案的建筑)的图像补全任务中显著提升了补全质量,而基线模型无法重建全局布局。
  • 该方法表明,当缺乏真实结构时,程序合成可生成有意义的监督信号,用于训练深度生成模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。