Skip to main content
QUICK REVIEW

[论文解读] Artist Style Transfer Via Quadratic Potential

Rahul Bhalley, Jianlin Su|arXiv (Cornell University)|Feb 14, 2019
Generative Adversarial Networks and Image Synthesis参考文献 31被引用 4
一句话总结

本文提出CycleGAN-QP,一种新颖的艺术家风格迁移方法,利用二次势能散度(QP)在无需Lipschitz约束的情况下稳定GAN训练,同时整合身份损失与循环一致性损失,并以上采样替代转置卷积,消除棋盘纹伪影。该方法在梵高、莫奈、塞尚和浮世绘等多种艺术风格下均生成高质量、无伪影的风格化图像。

ABSTRACT

In this paper we address the problem of artist style transfer where the painting style of a given artist is applied on a real world photograph. We train our neural networks in adversarial setting via recently introduced quadratic potential divergence for stable learning process. To further improve the quality of generated artist stylized images we also integrate some of the recently introduced deep learning techniques in our method. To our best knowledge this is the first attempt towards artist style transfer via quadratic potential divergence. We provide some stylized image samples in the supplementary material. The source code for experimentation was written in PyTorch and is available online in my GitHub repository.

研究动机与目标

  • 解决基于GAN的图像到图像翻译中的不稳定性与训练困难,特别是针对艺术家风格迁移任务。
  • 通过用二次势能散度(QP)替代传统散度,提升无监督图像翻译中的训练稳定性和收敛性。
  • 通过用近邻上采样加卷积替代转置卷积,消除生成风格化图像中的棋盘纹伪影。
  • 通过循环一致性损失与身份损失,实现在未配对的真实图像与艺术图像域之间的高保真风格迁移与重建。
  • 展示QP-GAN在多种艺术风格下生成逼真、高质量风格化图像的有效性。

提出的方法

  • 在判别器网络中采用二次势能散度(QP)作为训练目标,实现无需对判别器施加1-Lipschitz约束的稳定GAN训练。
  • 使用QP散度构建判别器损失,相比WGAN或标准GAN,可避免梯度消失,简化训练过程。
  • 将循环一致性损失与身份损失项整合进生成器目标函数,以保持内容并提升重建保真度。
  • 在生成器中用近邻上采样后接卷积层替代转置卷积层,以抑制棋盘纹伪影。
  • 使用Adam优化器以固定初始值0.0002、β1=0.5、β2=0.999,端到端训练生成器与判别器网络。
  • 通过随机水平翻转与中心裁剪至256×256分辨率进行数据增强,通道归一化使用均值与标准差0.5。

实验结果

研究问题

  • RQ1二次势能散度是否能在无需判别器权重裁剪或谱归一化的情况下,提升基于GAN的艺术家风格迁移训练的稳定性与收敛性?
  • RQ2与标准GAN和WGAN相比,所提出的QP-GAN框架在风格迁移中的图像质量与伪影抑制方面表现如何?
  • RQ3将转置卷积替换为上采样+卷积后,对生成风格化图像中棋盘纹伪影的抑制程度如何?
  • RQ4循环一致性损失与身份损失的结合是否能提升重建质量并保持风格迁移过程中的内容完整性?
  • RQ5该方法是否能在无需大量超参数调优的情况下,泛化至梵高、莫奈、塞尚和浮世绘等多种艺术风格?

主要发现

  • 所提出的CycleGAN-QP方法成功在多种艺术风格(包括梵高、莫奈、塞尚和浮世绘)下生成高质量风格化图像,如定性样本所示。
  • 通过用近邻上采样加卷积替代转置卷积,成功完全消除了生成图像中的棋盘纹伪影。
  • 采用QP方法实现了稳定训练,无需显式施加判别器权重约束或梯度惩罚。
  • 模型在单张NVIDIA K80 GPU上训练15,000轮(Ukiyo-e为12,000轮),每次训练运行约耗时1.25天。
  • 身份损失与循环一致性损失的使用提升了重建质量,使网络能够从风格化输出中恢复原始内容图像。
  • 该方法在无监督艺术家风格迁移任务中表现达到最先进水平,实验中未报告模式坍塌或训练失败现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。