Skip to main content
QUICK REVIEW

[论文解读] Multimodal Style Transfer via Graph Cuts

Yulun Zhang, Fang Chen|arXiv (Cornell University)|Apr 9, 2019
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 9
一句话总结

本文提出多模态风格迁移(MST),一种新颖方法,将图像风格建模为局部特征的多个聚类,而非全局统计量,利用图割(graph cuts)自适应地将这些子风格匹配到内容图像结构。通过聚类风格特征并基于图上的能量最小化求解风格-内容匹配,MST 生成更精确、无伪影的风格化结果,保留内容结构,并支持灵活的多风格混合,其在视觉质量和鲁棒性方面优于现有方法。

ABSTRACT

An assumption widely used in recent neural style transfer methods is that image styles can be described by global statics of deep features like Gram or covariance matrices. Alternative approaches have represented styles by decomposing them into local pixel or neural patches. Despite the recent progress, most existing methods treat the semantic patterns of style image uniformly, resulting unpleasing results on complex styles. In this paper, we introduce a more flexible and general universal style transfer technique: multimodal style transfer (MST). MST explicitly considers the matching of semantic patterns in content and style images. Specifically, the style image features are clustered into sub-style components, which are matched with local content features under a graph cut formulation. A reconstruction network is trained to transfer each sub-style and render the final stylized result. We also generalize MST to improve some existing methods. Extensive experiments demonstrate the superior effectiveness, robustness, and flexibility of MST.

研究动机与目标

  • 解决现有神经风格迁移方法将风格视为单峰分布所带来的局限,此类方法常导致视觉伪影,且难以处理复杂或具有空间结构的风格。
  • 将图像风格建模为多个子风格的混合(多峰表示),以更好地反映真实图像中风格模式的真实分布。
  • 开发基于图割的匹配机制,根据空间和语义配置自适应地将子风格与内容特征对齐。
  • 通过支持多风格混合和无需微调的用户可控子风格选择,提升风格迁移的鲁棒性与灵活性。
  • 将MST框架泛化以增强现有方法(如AdaIN和WCT),提升其在复杂风格上的表现。

提出的方法

  • 该方法使用预训练的VGG-19网络提取的特征嵌入,对风格图像的深层特征图进行k-means聚类,生成K个子风格。
  • 将风格-内容匹配建模为图上的能量最小化问题,其中节点代表内容特征,边编码内容与子风格聚类之间的兼容性。
  • 通过α扩张(α-expansion)求解图割优化,确保子风格到内容区域的全局最优分配,同时保持空间一致性。
  • 训练一个重建网络,独立地将每个子风格迁移并组合成最终的风格化图像。
  • 通过用所提出的多峰表示和基于图的匹配机制替代其全局风格统计量,该方法可泛化至现有方法。
  • 通过将不同风格图像中的模式视为独立的子风格,该框架支持多风格迁移,实现在无需手动掩码情况下的自适应混合。

实验结果

研究问题

  • RQ1将图像风格建模为多个局部子风格的混合是否能相比Gram矩阵等单峰表示,提升神经风格迁移的准确性和视觉质量?
  • RQ2如何通过可微且全局最优的公式,自适应地将风格模式匹配到内容结构?
  • RQ3所提出的多峰风格迁移框架在减少伪影和保持结构方面,能在多大程度上提升AdaIN和WCT等现有方法的性能?
  • RQ4子风格数量(K)在视觉质量和鲁棒性方面如何影响风格化结果?
  • RQ5该方法是否能实现灵活、用户可控的多风格迁移,而无需额外用户提供的掩码或重新训练?

主要发现

  • MST 显著减少了视觉伪影,如在平滑内容区域(如天空)中出现的不必要笔画,以及在复杂或主导性背景风格中出现的褪色效应。
  • 与AdaIN、WCT和LST相比,该方法在保留内容结构方面表现更优,尤其在大范围均匀背景或显著局部模式的情况下。
  • 当K=1时,MST的性能与基于全局统计量的方法相当;但随着K的增加,其与内容结构的对齐更优,失真更少。
  • 通过自适应地将不同风格模式分配给内容图像的不同区域,MST在多风格迁移中实现了视觉上一致的结果,优于AdaIN和WCT中的等权重混合方法。
  • 将MST泛化至AdaIN(即AdaIN + MST-K)可减少结构失真,例如错误地转移嘴部形状,通过实现局部风格自适应。
  • MST具备具有竞争力的推理速度——MST-1比AvatarNet和WCT更快,且即使K增大,由于采用CPU聚类,计算量增加仍保持实用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。