Skip to main content
QUICK REVIEW

[论文解读] Copy the Old or Paint Anew? An Adversarial Framework for (non-) Parametric Image Stylization

Nikolay Jetchev, Urs Bergmann|arXiv (Cornell University)|Nov 22, 2018
Generative Adversarial Networks and Image Synthesis参考文献 11被引用 4
一句话总结

本文提出完全对抗性马赛克(FAMOS),一种基于生成对抗网络(GAN)的新框架,结合参数化深度学习与非参数化样本风格化方法,实现仅使用小型风格数据集即可快速完成高分辨率图像风格迁移。通过使用全卷积U-Net生成器预测混合权重、混合掩码以及基于学习到的风格块记忆的生成内容,FAMOS在大规模输出上实现了比现有方法更快的速度与更高的质量,兼具快速推理与复杂风格的精确重建能力。

ABSTRACT

Parametric generative deep models are state-of-the-art for photo and non-photo realistic image stylization. However, learning complicated image representations requires compute-intense models parametrized by a huge number of weights, which in turn requires large datasets to make learning successful. Non-parametric exemplar-based generation is a technique that works well to reproduce style from small datasets, but is also compute-intensive. These aspects are a drawback for the practice of digital AI artists: typically one wants to use a small set of stylization images, and needs a fast flexible model in order to experiment with it. With this motivation, our work has these contributions: (i) a novel stylization method called Fully Adversarial Mosaics (FAMOS) that combines the strengths of both parametric and non-parametric approaches; (ii) multiple ablations and image examples that analyze the method and show its capabilities; (iii) source code that will empower artists and machine learning researchers to use and modify FAMOS.

研究动机与目标

  • 为解决参数化与非参数化风格迁移方法的局限性,结合二者优势:实现快速推理与精确风格再现。
  • 仅使用小型风格图像数据集,实现高效、高分辨率的风格迁移,适用于艺术创作实验。
  • 提供灵活、用户可控的框架,使艺术家可调节内容生成与直接风格复制之间的平衡。
  • 开发可扩展的全卷积架构,支持任意输出尺寸,并能泛化至未见的内容图像。

提出的方法

  • FAMOS使用单一U-Net生成器,预测混合矩阵A、生成图像IG以及用于混合内容与风格的混合掩码α。
  • 非参数化记忆M存储从风格图像中提取的、经过随机偏移的瓦片化块,实现在推理阶段直接复制风格。
  • 生成结果为 I = α ⊙ IG + (1−α) ⊙ IM,其中IM通过混合矩阵A从记忆M中复制得到。
  • 模型采用联合损失函数进行训练:在局部图像块的真假判别上使用对抗损失,同时利用特征图φ的感知内容重建损失。
  • 裁剪坐标ψ用于编码记忆块的空间偏移,且在内容与记忆块之间共享,以提升泛化能力。
  • 该方法支持对未见内容图像的泛化(通过随机裁剪),也支持对特定图像实现高保真度马赛克(通过固定裁剪)。

实验结果

研究问题

  • RQ1基于GAN的框架能否有效结合参数化生成与非参数化样本复制,实现快速、高质量的风格迁移?
  • RQ2与纯参数化模型相比,使用学习到的风格块记忆如何提升风格迁移的准确性?
  • RQ3诸如权重共享与坐标编码等架构设计选择,如何增强风格迁移中的泛化能力与性能表现?
  • RQ4在未见内容图像上,模型在泛化模式与固定空间对齐模式下的性能表现有何差异?

主要发现

  • FAMOS实现了高达2000×2400像素的高分辨率风格迁移,推理速度快,支持实时艺术创作实验。
  • 通过共享U-Net同时预测混合矩阵与混合掩码,显著减小模型尺寸与推理时间,且未牺牲生成质量。
  • 使用WGAN-GP损失可提升使用非参数化记忆时的训练稳定性,而当记忆禁用时,DCGAN损失表现更优。
  • 对记忆块进行随机偏移可提升对未见内容图像的泛化能力,而固定裁剪则能为特定图像提供更高保真度输出。
  • 在输入中添加空间噪声可稳定训练过程,尽管输出对噪声不敏感,表明模型对随机输入具有鲁棒性。
  • 直接将记忆M作为生成器输入会增加计算开销但未提升生成质量,因此效率低下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。