Skip to main content
QUICK REVIEW

[论文解读] Precomputed Real-Time Texture Synthesis with Markovian Generative Adversarial Networks

Chuan Li, Michael Wand|arXiv (Cornell University)|Apr 15, 2016
Generative Adversarial Networks and Image Synthesis参考文献 28被引用 17
一句话总结

本文提出马尔可夫生成对抗网络(MGANs),一种通过从单个示例中学习马尔可夫块统计特性,预先计算前馈、步长卷积网络以实现实时纹理合成的方法。该方法实现了每秒25帧(25Hz)的0.25M像素图像生成速度,比以往基于神经网络的纹理合成方法快逾500倍,同时通过对抗训练保持了高视觉质量。

ABSTRACT

This paper proposes Markovian Generative Adversarial Networks (MGANs), a method for training generative neural networks for efficient texture synthesis. While deep neural network approaches have recently demonstrated remarkable results in terms of synthesis quality, they still come at considerable computational costs (minutes of run-time for low-res images). Our paper addresses this efficiency issue. Instead of a numerical deconvolution in previous work, we precompute a feed-forward, strided convolutional network that captures the feature statistics of Markovian patches and is able to directly generate outputs of arbitrary dimensions. Such network can directly decode brown noise to realistic texture, or photos to artistic paintings. With adversarial training, we obtain quality comparable to recent neural texture synthesis methods. As no optimization is required any longer at generation time, our run-time performance (0.25M pixel images at 25Hz) surpasses previous neural texture synthesizers by a significant margin (at least 500 times faster). We apply this idea to texture synthesis, style transfer, and video stylization.

研究动机与目标

  • 解决基于深度神经网络的纹理合成方法计算成本过高的问题,后者每张图像需要数分钟的优化时间。
  • 通过在生成阶段消除迭代优化,实现神经纹理合成的实时推理。
  • 在显著提升速度的同时,保持与最先进基于优化方法相当的高视觉质量。
  • 开发一种适用于纹理合成、风格迁移和视频风格化的框架,每种风格仅需一个预计算模型。
  • 通过使用预训练的VGG网络学习同一内容不同表现形式之间的映射,实现对内容和风格的不变性。

提出的方法

  • 预计算一个前馈、步长卷积网络,用于反转来自预训练VGG-19网络的马尔可夫块特征统计。
  • 使用对抗训练方法训练网络,以保持与基于优化方法相当的图像质量。
  • 使用布朗噪声作为输入,直接解码出逼真的纹理,无需迭代优化。
  • 利用VGG-19网络至ReLU4_1层提取高层、不变的特征,以实现鲁棒的风格迁移。
  • 应用预计算的网络生成任意分辨率的图像,无需融合或额外优化。
  • 在单个纹理示例和多样化的ImageNet图像上进行训练,以学习可泛化的、与风格相关的特征映射。

实验结果

研究问题

  • RQ1对抗训练能否在马尔可夫设置下有效应用,以学习一种快速、前馈的生成模型用于纹理合成?
  • RQ2预计算的、步长卷积网络在多大程度上可以替代神经纹理合成中基于反卷积的迭代优化?
  • RQ3与基于优化的方法相比,预计算生成模型在速度和视觉质量方面的表现如何?
  • RQ4该模型能否在保持目标纹理风格的同时,泛化到不同的内容图像?
  • RQ5该方法在处理非纹理性、语义性内容(如面部特征或复杂布局)方面存在哪些局限性?

主要发现

  • MGAN方法在NVIDIA TitanX上以40ms(25Hz)的速度生成512×512图像,相比Li等人[21]的方法提速500倍,相比Gatys等人[8]的方法提速超过5000倍。
  • 该方法实现了与基于优化方法相当的视觉质量,由于从大规模数据中学习,结果与示例纹理的一致性更高。
  • 512×512图像的内存占用约为2.5GB,模型参数总量为70MB,包含至ReLU4_1的VGG-19网络。
  • 该模型在具有可识别特征和复杂内容的纹理上表现最佳,而在平坦或静态区域(如天空或模糊区域)表现较差。
  • 与基于高斯的模型[8, 32]相比,该方法在复杂内容上更有效地保持了纹理的一致性,但在全局色彩分布上可能存在偏差。
  • 由于缺乏语义理解,该方法无法在照片之间转移面部特征,凸显了其在处理非纹理性、高层语义内容方面的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。