Skip to main content
QUICK REVIEW

[论文解读] ReCoNet: Real-time Coherent Video Style Transfer Network

Chang Gao, Derun Gu|arXiv (Cornell University)|Jul 3, 2018
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 10
一句话总结

ReCoNet 是一种实时、前馈式的视频风格迁移网络,通过在输出级时序损失中引入亮度扭曲约束,以及在特征图级引入时序损失,实现了高时间一致性和感知风格质量。该方法在单张GPU上实现超过200 FPS的风格化视频生成速度,显著减少了运动物体和光照变化下的闪烁和颜色不一致现象。

ABSTRACT

Image style transfer models based on convolutional neural networks usually suffer from high temporal inconsistency when applied to videos. Some video style transfer models have been proposed to improve temporal consistency, yet they fail to guarantee fast processing speed, nice perceptual style quality and high temporal consistency at the same time. In this paper, we propose a novel real-time video style transfer model, ReCoNet, which can generate temporally coherent style transfer videos while maintaining favorable perceptual styles. A novel luminance warping constraint is added to the temporal loss at the output level to capture luminance changes between consecutive frames and increase stylization stability under illumination effects. We also propose a novel feature-map-level temporal loss to further enhance temporal consistency on traceable objects. Experimental results indicate that our model exhibits outstanding performance both qualitatively and quantitatively.

研究动机与目标

  • 解决视频风格迁移中的高时间不一致性问题,特别是运动物体和光照变化下的闪烁与颜色不稳定现象。
  • 在不牺牲感知风格质量或时间一致性的前提下,实现高于24 FPS的实时处理速度。
  • 通过建模帧间亮度变化,提升动态光照条件下的风格化稳定性。
  • 通过惩罚高层特征图中的特征变化,提升可追踪物体在帧间的一致性。

提出的方法

  • 在输出级时序损失中引入亮度扭曲约束,以建模连续帧之间的亮度变化,提升光照变化下的稳定性。
  • 在特征图级应用时序损失,以惩罚同一物体在连续帧之间的特征变化,增强高层表征中的一致性。
  • 采用基于VGG的感知损失的前馈编码器-解码器架构,以保持内容和风格的一致性。
  • 在时序损失中引入光流和遮挡掩码作为引导,使风格化帧与输入运动对齐。
  • 设计多级时序损失,结合输出级和特征图级约束,联合优化视觉一致性和感知质量。
  • 构建轻量化、端到端的网络,实现在现代GPU上超过200 FPS的推理速度。

实验结果

研究问题

  • RQ1前馈网络能否在保持高感知风格质量和时间一致性的同时,实现实时视频风格迁移?
  • RQ2如何建模连续帧之间的亮度变化,以提升光照变化下的风格化稳定性?
  • RQ3在高层特征图中强制特征一致性在多大程度上可减少可追踪物体的时间不一致性?
  • RQ4输出级和特征图级时序损失对整体时间一致性的相对贡献如何?

主要发现

  • ReCoNet 在单张现代GPU上实现超过200 FPS的推理速度,显著超越实时标准。
  • 与未使用亮度建模的基线方法相比,输出级时序损失中的亮度扭曲约束平均将时间误差降低10.4%。
  • 与仅使用输出级时序损失的模型相比,特征图级时序损失平均将时间误差降低12.5%。
  • 在MPI Sintel数据集上,同时使用输出级和特征图级时序损失的联合方法实现了最低的平均时间误差0.0804。
  • 用户研究表明,与先前方法相比,ReCoNet 生成的风格化视频在感知稳定性与视觉一致性方面更优,尤其在光照变化和运动物体场景中表现更佳。
  • 定性结果表明,ReCoNet 有效抑制了运动物体圈出区域的闪烁和颜色不一致现象,在视觉稳定性方面优于基线方法如Chen et al. [4]。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。