Skip to main content
QUICK REVIEW

[论文解读] CCPL: Contrastive Coherence Preserving Loss for Versatile Style Transfer

Zijie Wu, Zhu Zhen|arXiv (Cornell University)|Jul 11, 2022
Image Enhancement Techniques被引用 11
一句话总结

本文提出对比一致性保持损失(CCPL),一种基于对比学习的新损失函数,通过在帧间保持局部块级特征差异来增强视频风格迁移中的时间一致性,且无需视频训练数据。CCPL在艺术风格、照片级真实感及视频风格迁移中均提升了视觉质量和一致性,同时与现有网络兼容,并可应用于图像到图像的迁移任务。

ABSTRACT

In this paper, we aim to devise a universally versatile style transfer method capable of performing artistic, photo-realistic, and video style transfer jointly, without seeing videos during training. Previous single-frame methods assume a strong constraint on the whole image to maintain temporal consistency, which could be violated in many cases. Instead, we make a mild and reasonable assumption that global inconsistency is dominated by local inconsistencies and devise a generic Contrastive Coherence Preserving Loss (CCPL) applied to local patches. CCPL can preserve the coherence of the content source during style transfer without degrading stylization. Moreover, it owns a neighbor-regulating mechanism, resulting in a vast reduction of local distortions and considerable visual quality improvement. Aside from its superior performance on versatile style transfer, it can be easily extended to other tasks, such as image-to-image translation. Besides, to better fuse content and style features, we propose Simple Covariance Transformation (SCT) to effectively align second-order statistics of the content feature with the style feature. Experiments demonstrate the effectiveness of the resulting model for versatile style transfer, when armed with CCPL.

研究动机与目标

  • 解决仅在单帧图像上进行训练时视频风格迁移中的时间不一致性挑战。
  • 在不依赖光流或显式视频监督的情况下,减少风格化视频输出中的闪烁和局部失真。
  • 开发一种轻量级、与架构无关的损失函数,以在多种风格迁移任务中同时提升视觉质量和时间一致性。
  • 实现该损失函数在现有图像到图像迁移和风格迁移模型上的有效应用,仅需极少修改。
  • 通过可学习的损失加权机制,平衡风格化质量与时间一致性。

提出的方法

  • 将内容图像与风格化图像之间的局部块差异定义为特征级表示,以捕捉局部运动一致性。
  • 使用InfoNCE损失进行对比学习,最大化正样本对(跨帧相同空间位置)之间的互信息,同时最小化负样本对之间的互信息。
  • 引入邻域调节机制,基于空间邻近块约束每个块,以减少局部失真。
  • 在每层中采样多个负样本块差异,以稳定对比学习并提升泛化能力。
  • 将CCPL作为即插即用的损失模块集成到现有风格迁移网络中,实现在单图上训练的同时泛化至视频任务。
  • 提出简单协方差变换(SCT),以对齐内容与风格特征的二阶统计量,实现更优的特征融合。

实验结果

研究问题

  • RQ1在训练期间无视频数据的情况下,基于局部块差异的对比损失是否能有效保持视频风格迁移的时间一致性?
  • RQ2CCPL中的邻域调节机制如何减少局部失真并提升视觉质量?
  • RQ3在层数、采样向量数和损失加权方面,CCPL的最佳配置是什么,以实现一致性与风格化之间的最佳平衡?
  • RQ4CCPL是否能有效迁移至基础架构之外的其他图像到图像迁移与风格迁移模型?
  • RQ5CCPL是否能在包括艺术风格、照片级真实感和视频风格迁移在内的多样化风格迁移任务中提升性能,同时不损害风格化质量?

主要发现

  • CCPL显著提升了视频风格迁移的时间一致性,即使仅在单帧图像上训练,也能有效减少闪烁和不连贯现象。
  • 在单张12GB Titan XP GPU上,256×256分辨率下推理速度达到77.0 FPS,优于先前方法在速度与质量上的表现。
  • 消融实验表明,将CCPL应用于3层,每层采样64个向量,损失权重比为0.5时,可在一致性与风格化之间取得最佳平衡。
  • 在AdaIN、SANet和Linear网络上应用CCPL后,时间一致性显著提升,SIFID分数仅出现轻微下降,证明其良好的泛化能力。
  • 将CCPL应用于CUT模型可提升图像到图像迁移的性能,同时增强视觉质量与一致性,证实其广泛适用性。
  • CCPL的邻域调节机制有效减少局部失真,使输出更加清晰且连贯,优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。