Skip to main content
QUICK REVIEW

[论文解读] Characterizing and Improving Stability in Neural Style Transfer

Agrim Gupta, Justin Johnson|arXiv (Cornell University)|May 5, 2017
Generative Adversarial Networks and Image Synthesis参考文献 31被引用 18
一句话总结

本文识别出神经风格迁移中不稳定的根源——具体而言,是风格图像的Gram矩阵的迹与解集稳定性之间的反比关系——并提出一种带有时间一致性损失的循环卷积网络,以实现实时、无闪烁的风格化视频。该方法在比以往基于优化的方法快1000倍的同时,实现了接近最优的质量。

ABSTRACT

Recent progress in style transfer on images has focused on improving the quality of stylized images and speed of methods. However, real-time methods are highly unstable resulting in visible flickering when applied to videos. In this work we characterize the instability of these methods by examining the solution set of the style transfer objective. We show that the trace of the Gram matrix representing style is inversely related to the stability of the method. Then, we present a recurrent convolutional network for real-time video style transfer which incorporates a temporal consistency loss and overcomes the instability of prior methods. Our networks can be applied at any resolution, do not re- quire optical flow at test time, and produce high quality, temporally consistent stylized videos in real-time.

研究动机与目标

  • 研究并表征在视频应用中实时神经风格迁移方法出现闪烁不稳定的根源。
  • 识别出风格图像Gram矩阵的迹是影响风格迁移解集稳定性的关键因素。
  • 开发一种实时视频风格迁移方法,确保高视觉质量的同时实现时间一致性。
  • 通过结合前馈方法(无闪烁)和基于优化的方法(速度快)的优势,克服两者的局限性。

提出的方法

  • 作者分析了风格迁移中Gram矩阵匹配目标的解集,表明其形成一个球体,其半径取决于风格图像Gram矩阵的迹。
  • 提出一种循环卷积神经网络(R-CNN),按顺序处理视频帧,以保持帧间的时间一致性。
  • 引入时间一致性损失,以鼓励在连续时间步长上对Gram矩阵匹配目标的解保持相似。
  • 该方法在推理阶段无需光流,避免了光流估计错误带来的误差。
  • 网络通过内容损失、风格损失和时间一致性损失的组合进行端到端训练。
  • 该方法可泛化至不同分辨率,且无需微调即可支持任意风格迁移。

实验结果

研究问题

  • RQ1在将实时神经风格迁移应用于视频时,观察到的不稳定和闪烁现象的根本原因是什么?
  • RQ2风格图像Gram矩阵的迹与风格迁移解集稳定性之间有何关系?
  • RQ3带有时间一致性损失的循环架构能否实现高质量、实时的视频风格迁移,且显著减少闪烁?
  • RQ4与前馈方法和基于优化的风格迁移基线相比,所提方法在性能和稳定性方面表现如何?

主要发现

  • 风格图像Gram矩阵的迹与解集稳定性呈反比关系:迹越大,不稳定性与闪烁越严重。
  • 所提出的循环网络在Rain Princess风格下实现了27.76/0.9194的PSNR/SSIM,显著优于实时基线(26.00/0.7432)的时间一致性表现。
  • 用户研究表明,213名参与者中有133名更偏好所提方法,其感知闪烁显著更少。
  • 该方法将闪烁减少至接近基于优化的基线水平(例如,PSNR/SSIM为23.44/0.9240,而优化基线为23.68/0.9136),同时速度提升了1000倍。
  • 该方法对输入失真具有鲁棒性,保持的图像相似度与自然图像对相当,而实时基线的相似度则急剧下降。
  • 该方法避免了推理阶段对光流的依赖,消除了因光流估计错误导致的失败模式,这一点在Sintel数据集上得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。