Skip to main content
QUICK REVIEW

[论文解读] Avatar-Net: Multi-scale Zero-shot Style Transfer by Feature Decoration

Lu Sheng, Ziyi Lin|arXiv (Cornell University)|May 10, 2018
Generative Adversarial Networks and Image Synthesis参考文献 28被引用 14
一句话总结

Avatar-Net 提出了一种基于补丁的多尺度、零样本风格迁移方法,通过风格装饰模块对内容和风格特征进行对齐,同时保持语义内容和细节模式。通过将该模块集成到多尺度沙漏网络中,模型在单次前向传播中实现了最先进的风格化质量和效率,支持如视频风格化和风格混合等实时应用。

ABSTRACT

Zero-shot artistic style transfer is an important image synthesis problem aiming at transferring arbitrary style into content images. However, the trade-off between the generalization and efficiency in existing methods impedes a high quality zero-shot style transfer in real-time. In this paper, we resolve this dilemma and propose an efficient yet effective Avatar-Net that enables visually plausible multi-scale transfer for arbitrary style. The key ingredient of our method is a style decorator that makes up the content features by semantically aligned style features from an arbitrary style image, which does not only holistically match their feature distributions but also preserve detailed style patterns in the decorated features. By embedding this module into an image reconstruction network that fuses multi-scale style abstractions, the Avatar-Net renders multi-scale stylization for any style image in one feed-forward pass. We demonstrate the state-of-the-art effectiveness and efficiency of the proposed method in generating high-quality stylized images, with a series of applications include multiple style integration, video stylization and etc.

研究动机与目标

  • 解决零样本风格迁移中泛化能力与效率之间的权衡问题。
  • 在无需微调的情况下,为任意未见过的风格实现高质量风格化。
  • 在单次推理过程中实现多尺度风格化,以支持实时应用。
  • 在不扭曲内容的前提下,同时保留全局风格分布与细粒度风格模式。
  • 开发一种与风格无关、可端到端训练的架构,能够从风格化特征中重建自然图像。

提出的方法

  • 引入一种基于补丁的风格装饰模块,利用来自任意风格图像的语义对齐风格特征,对内容特征进行装饰。
  • 该风格装饰模块通过最小化内容特征与风格特征之间的分布差异,同时显式地提取细粒度风格模式。
  • 采用具有多尺度跳跃连接的沙漏网络,实现在特征层次上的整体性、多尺度风格适应。
  • 使用与风格无关的图像解码器,从装饰后的特征中重建风格化图像,确保内容的可感知性。
  • 仅通过自然图像重建任务训练沙漏网络,避免依赖感知损失或风格特定的监督信号。
  • 通过一次前向传播处理多尺度特征,实现高效推理,可选地通过补丁采样进一步降低计算成本。

实验结果

研究问题

  • RQ1能否通过单次前向传播网络在多样且任意的风格上实现高质量的零样本风格迁移?
  • RQ2如何在保持内容语义的前提下,保留风格化输出中的细粒度风格模式?
  • RQ3能否在不使用迭代优化或风格特定训练的情况下,有效实现多尺度风格适应?
  • RQ4特征分布匹配与局部模式检索对风格化质量有何影响?
  • RQ5与现有前向传播方法和基于优化的方法相比,该方法在效率与视觉质量方面表现如何?

主要发现

  • Avatar-Net 在零样本风格迁移中实现了最先进的视觉质量,其表现优于 WCT、AdaIN 和 Style-Swap 等方法,在感知质量与模式保真度方面均更优。
  • 该模型即使在处理如笔触和圆形图案等复杂风格时,也能生成视觉上合理且内容结构保持完整的风格化图像。
  • Avatar-Net 通过单次前向传播实现实时风格化,推理速度显著优于基于优化的方法(如 Gatys et al.)。
  • 该方法在视频风格化中表现出稳定性能,有效避免了 WCT 中常见的时序闪烁与内容失真问题。
  • 通过在风格装饰模块中引入随机补丁采样,进一步提升了效率,计算量降低但质量损失极小。
  • 该模型支持灵活的应用,如风格插值、多风格融合以及通过特征混合调节风格化强度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。