Skip to main content
QUICK REVIEW

[论文解读] Parameter-Free Style Projection for Arbitrary Style Transfer

Siyu Huang, Haoyi Xiong|arXiv (Cornell University)|Mar 17, 2020
Generative Adversarial Networks and Image Synthesis参考文献 35被引用 5
一句话总结

本文提出风格投影(Style Projection),一种无需参数、快速且高效的图像风格迁移特征级变换方法,在保留内容细节的同时准确迁移风格。通过根据内容特征的排序顺序重新排列风格特征,该方法在内容保留与风格迁移之间实现了更优的平衡,其在定性、定量及用户研究中均优于AdaIN与WCT等方法,且实现每张图像0.068秒的实时推理速度。

ABSTRACT

Arbitrary image style transfer is a challenging task which aims to stylize a content image conditioned on arbitrary style images. In this task the feature-level content-style transformation plays a vital role for proper fusion of features. Existing feature transformation algorithms often suffer from loss of content or style details, non-natural stroke patterns, and unstable training. To mitigate these issues, this paper proposes a new feature-level style transformation technique, named Style Projection, for parameter-free, fast, and effective content-style transformation. This paper further presents a real-time feed-forward model to leverage Style Projection for arbitrary image style transfer, which includes a regularization term for matching the semantics between input contents and stylized outputs. Extensive qualitative analysis, quantitative evaluation, and user study have demonstrated the effectiveness and efficiency of the proposed methods.

研究动机与目标

  • 解决任意图像风格迁移中内容保留与风格迁移之间的平衡难题,现有方法常导致内容细节丢失或引入不自然伪影。
  • 克服基于归一化方法(如AdaIN)仅传递一阶统计量,以及基于WCT的方法因白化操作导致内容退化的局限性。
  • 开发一种无需参数、快速且有效的特征变换技术,利用顺序统计量更自然地融合内容与风格特征。
  • 设计一种实时前馈模型,集成风格投影与KL散度损失,以提升输入内容与生成风格化输出之间的语义一致性。
  • 通过全面评估(包括定量指标、定性分析、消融研究与用户研究)证明所提方法的有效性。

提出的方法

  • 提出风格投影(Style Projection):一种无需参数的特征变换方法,根据内容特征的排序顺序重新排列风格特征,从而保留空间结构与纹理细节。
  • 将内容与风格特征图在空间维度(H×W)上展平为一维向量,计算两者的排序索引以对齐其相对大小关系。
  • 将排序后风格特征向量的值重新分配至由内容特征排名所决定的位置,确保内容中高/低激活区域引导对应风格激活的放置。
  • 将重新排序的特征向量重塑为原始空间维度,用于解码器网络以生成风格化图像。
  • 引入内容特征与风格化特征之间的KL散度损失,以正则化语义一致性并提升结构保真度。
  • 采用带跳跃连接的前馈编码器-解码器架构(在完整模型中),进一步提升重建质量并保留细粒度内容细节。

实验结果

研究问题

  • RQ1无参数特征变换方法是否能在内容保留与风格迁移之间实现优于现有基于归一化或白化方法的平衡?
  • RQ2在特征融合中利用顺序统计量(如排序)是否能生成比仅依赖一阶统计量的方法更自然、更符合人类感知的风格化图像?
  • RQ3像风格投影这样简单且非学习的变换方法,是否能在速度与视觉质量方面超越学习型或优化型方法?
  • RQ4添加KL散度损失与跳跃连接在多大程度上提升了任意风格迁移中的语义一致性和视觉保真度?
  • RQ5用户在锐度、风格准确性与自然性方面,如何评价风格投影生成的风格化图像质量,相较于最先进方法?

主要发现

  • 风格投影(Ours-1)在性能上与最先进方法相当,相比WCT更有效地保留内容细节,相比AdaIN减少非自然笔触。
  • 完整模型(SP+Skip+KL,Ours-2)在人物图像上获得78.03%的用户偏好得分,总体达65.53%,显著优于AdaIN与仅使用风格投影的方法。
  • 该方法每张图像仅需0.068秒推理时间,远快于基于优化的方法(如DFR,114秒/张),同时生成更优的视觉结果。
  • 定量评估显示,SP+Skip+KL在内容损失(2.09)与风格损失(2.58)之间取得更优的权衡,两项指标均优于AdaIN与WCT。
  • 用户成对比较中的一致性达到76.52%(人物图像)与68.94%(场景图像),表明用户对本方法优越性的评价高度一致。
  • 消融研究证实,跳跃连接与KL散度损失均对提升视觉质量与语义一致性具有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。