Skip to main content
QUICK REVIEW

[论文解读] QuantArt: Quantizing Image Style Transfer Towards High Visual Fidelity

Siyu Huang, Jie An|arXiv (Cornell University)|Dec 20, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

QuantArt 提出了一种新颖的图像风格迁移框架,通过使用向量量化将生成的艺术作品潜在特征与真实艺术作品分布的聚类中心对齐,从而提升视觉保真度。通过在风格引导注意力模块中融合连续与离散潜在表示,QuantArt 在保持强大内容与风格保留的同时,实现了最先进的视觉保真度。

ABSTRACT

The mechanism of existing style transfer algorithms is by minimizing a hybrid loss function to push the generated image toward high similarities in both content and style. However, this type of approach cannot guarantee visual fidelity, i.e., the generated artworks should be indistinguishable from real ones. In this paper, we devise a new style transfer framework called QuantArt for high visual-fidelity stylization. QuantArt pushes the latent representation of the generated artwork toward the centroids of the real artwork distribution with vector quantization. By fusing the quantized and continuous latent representations, QuantArt allows flexible control over the generated artworks in terms of content preservation, style similarity, and visual fidelity. Experiments on various style transfer settings show that our QuantArt framework achieves significantly higher visual fidelity compared with the existing style transfer methods.

研究动机与目标

  • 为解决现有风格迁移方法在视觉保真度方面的不足,这些方法往往无法生成与真实艺术作品难以区分的图像。
  • 定义并量化视觉保真度作为与风格相似性和内容保留正交的新评估维度。
  • 开发一种框架,实现在风格化图像中内容保留、风格相似性和视觉保真度之间的灵活权衡。
  • 利用向量量化将生成特征推向真实艺术作品分布的中心,从而提升真实感。
  • 设计一种双分支架构(连续与量化),实现在不牺牲感知质量的前提下可控的风格化。

提出的方法

  • 通过向量量化学习一个全局艺术作品码书,以表示真实艺术作品特征的离散聚类中心。
  • 使用独立的编码器对内容和风格特征分别应用向量量化,从连续特征生成离散码。
  • 使用风格引导注意力(SGA)模块,将风格码传递到风格化特征图,同时保留内容结构。
  • 在解码前使用艺术作品码书对风格化特征进行重新量化,以确保与真实艺术作品分布对齐。
  • 在解码器之前,将内容特征与连续和量化后的风格化特征进行融合,以实现对输出质量的灵活控制。
  • 使用结合LPIPS、Gram损失和基于FID的监督的混合损失进行模型训练,以优化感知质量和分布对齐。

实验结果

研究问题

  • RQ1与现有风格迁移方法相比,潜在特征的向量量化是否能提升生成风格化图像的视觉保真度?
  • RQ2融合连续与离散潜在表示如何影响内容保留、风格相似性和视觉真实感之间的平衡?
  • RQ3在图像风格迁移中实现高视觉保真度的最优码书大小和量化策略是什么?
  • RQ4所提出的QuantArt框架是否在显著提升视觉保真度的同时,仍能保持较强的风格相似性?
  • RQ5该模型能否在人类感知测试中生成与真实艺术作品几乎无法区分的风格化图像?

主要发现

  • QuantArt在测试集上实现了17.787的Fréchet Inception Distance(FID),显著优于基线方法,表明其具有极高的视觉保真度。
  • 在人类感知测试中,参与者平均仅能正确识别出20道题中的10.31幅真实艺术作品,接近随机猜测水平,表明生成图像与真实作品几乎无法区分。
  • 消融实验表明,若在风格引导注意力模块中移除量化,FID将从17.787上升至18.757,证实了量化对视觉保真度的重要性。
  • 使用16×16的码书尺寸可获得最佳FID(17.787),而更小(8×8)或更大(32×32)的补丁尺寸均导致性能下降,表明该尺寸为风格化任务的最优补丁大小。
  • 若将SGA模块替换为StyTR2解码层,FID将上升至26.299,表明所提出的SGA设计对保持高质量输出至关重要。
  • 若在连续与量化分支之间共享编码器,FID将急剧上升至35.830,证明独立编码器对于保持表示质量至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。