Skip to main content
QUICK REVIEW

[论文解读] Improved Texture Networks: Maximizing Quality and Diversity in Feed-forward Stylization and Texture Synthesis

Dmitry Ulyanov, Andrea Vedaldi|arXiv (Cornell University)|Jan 9, 2017
Generative Adversarial Networks and Image Synthesis参考文献 17被引用 4
一句话总结

该论文通过引入实例归一化以提升视觉质量,并采用基于Julesz集合的多样性鼓励学习目标,改进了用于图像风格迁移与纹理合成的前馈神经网络。结果是生成速度更快、质量更高、多样性更强的风格化图像与纹理,其性能接近缓慢的优化方法,同时保持实时推理速度。

ABSTRACT

The recent work of Gatys et al., who characterized the style of an image by the statistics of convolutional neural network filters, ignited a renewed interest in the texture generation and image stylization problems. While their image generation technique uses a slow optimization process, recently several authors have proposed to learn generator neural networks that can produce similar outputs in one quick forward pass. While generator networks are promising, they are still inferior in visual quality and diversity compared to generation-by-optimization. In this work, we advance them in two significant ways. First, we introduce an instance normalization module to replace batch normalization with significant improvements to the quality of image stylization. Second, we improve diversity by introducing a new learning formulation that encourages generators to sample unbiasedly from the Julesz texture ensemble, which is the equivalence class of all images characterized by certain filter responses. Together, these two improvements take feed forward texture synthesis and image stylization much closer to the quality of generation-via-optimization, while retaining the speed advantage.

研究动机与目标

  • 解决快速前馈风格迁移网络与较慢的基于优化的方法(如Gatys等人提出的方法)之间的视觉质量差距。
  • 提升生成纹理与风格化图像的多样性,尽管现有前馈网络速度快,但其多样性仍受限。
  • 提出一种训练范式,促使生成器从Julesz集合中均匀采样,确保输出多样性。
  • 证明架构改进与新型学习目标可显著提升质量与多样性,同时不牺牲推理速度。

提出的方法

  • 在生成器网络中,特别是用于风格迁移的网络,用实例归一化替代批量归一化,以更好地归一化与内容相关的特征,提升训练稳定性和性能。
  • 设计一种学习目标,最小化生成分布与Julesz集合上准均匀分布之间的Kullback-Leibler散度,以促进多样性。
  • 使用可微的非参数估计器估计生成样本的熵,从而实现端到端训练多样性诱导目标。
  • 将熵项作为负熵惩罚整合到损失函数中,通过超参数λ平衡重建保真度与多样性。
  • 使用组合损失进行生成器训练:标准风格重建损失(类似于Gatys等人)减去λ倍的生成样本熵估计值。
  • 在生成器g(x₀, z)中使用噪声z作为随机种子,当z变化时,可为同一内容图像x₀生成多样化输出。

实验结果

研究问题

  • RQ1与批量归一化相比,实例归一化是否能显著提升前馈风格迁移网络的视觉质量?
  • RQ2一种鼓励从Julesz集合中均匀采样的学习目标,是否能带来更丰富的纹理与风格化图像生成?
  • RQ3实例归一化与基于熵的多样性正则化相结合,能否在保持实时推理的同时,产生媲美基于优化方法的质量结果?
  • RQ4多样性超参数λ如何影响纹理与风格化网络中视觉保真度与输出多样性的权衡?
  • RQ5通过这些方法训练的前馈网络,在多大程度上能匹配缓慢迭代优化技术的感知质量?

主要发现

  • 实例归一化显著提升了风格迁移网络的训练收敛速度与视觉质量,StyleNet IN在训练损失和定性结果上均优于StyleNet BN。
  • 实例归一化的使用使生成器能够从更优的初始化点开始优化,从而减少达到高质量结果所需的优化步数。
  • 基于熵的多样性正则化使高容量生成器(如TextureNetV2)在不损失视觉质量的前提下产生多样化输出,而标准训练则会导致模式崩溃。
  • 当λ调优得当时,多样性项能有效防止模式崩溃,生成多样化且高保真的纹理与风格化图像,同时避免因λ过高而产生的伪影。
  • 所提方法在视觉质量上可与Gatys等人提出的缓慢优化方法相媲美,经定性对比验证,人类观察者更偏好新方法的结果而非现有快速网络的结果。
  • 该方法保持了实时推理速度,生成器仅需一次前向传播即可输出风格化图像与纹理,速度比迭代优化方法快三个数量级。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。