Skip to main content
QUICK REVIEW

[论文解读] Learning Graph Neural Networks for Image Style Transfer

Yongcheng Jing, Yining Mao|arXiv (Cornell University)|Jul 24, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出了一种基于图神经网络(GNNs)的半参数化神经风格迁移框架,通过在局部图像块层面建立可学习的细粒度内容-风格对应关系,实现更优的风格迁移效果。通过将风格迁移建模为异质图中内容节点与风格节点之间的基于注意力的消息传递机制,该方法减少了因图像块错配导致的伪影,同时保持了全局风格的一致性与局部细节的完整性,在推理阶段通过动态控制边连接,实现了灵活且多样的输出风格。

ABSTRACT

State-of-the-art parametric and non-parametric style transfer approaches are prone to either distorted local style patterns due to global statistics alignment, or unpleasing artifacts resulting from patch mismatching. In this paper, we study a novel semi-parametric neural style transfer framework that alleviates the deficiency of both parametric and non-parametric stylization. The core idea of our approach is to establish accurate and fine-grained content-style correspondences using graph neural networks (GNNs). To this end, we develop an elaborated GNN model with content and style local patches as the graph vertices. The style transfer procedure is then modeled as the attention-based heterogeneous message passing between the style and content nodes in a learnable manner, leading to adaptive many-to-one style-content correlations at the local patch level. In addition, an elaborated deformable graph convolutional operation is introduced for cross-scale style-content matching. Experimental results demonstrate that the proposed semi-parametric image stylization approach yields encouraging results on the challenging style patterns, preserving both global appearance and exquisite details. Furthermore, by controlling the number of edges at the inference stage, the proposed method also triggers novel functionalities like diversified patch-based stylization with a single model.

研究动机与目标

  • 为解决参数化方法的局限性,后者因全局统计量对齐而无法保留细粒度的局部风格模式。
  • 克服非参数化方法中因一对一图像块匹配和内容-风格错配导致的伪影问题。
  • 开发一种半参数化框架,实现在图像块层面的自适应、多对一内容-风格对应关系学习。
  • 通过在推理阶段控制边连接,使单一训练模型能够生成灵活且多样的风格化输出。
  • 通过可变形图卷积操作,增强跨尺度的内容-风格匹配能力。

提出的方法

  • 构建一个异质图,将内容和风格特征块视为不同类型的节点。
  • 采用图注意力网络(GAT)实现基于注意力的消息传递,为每个内容节点聚合最相似的k个风格块。
  • 引入具有可学习尺度预测器的可变形图卷积层,以实现跨尺度特征匹配和空间自适应的笔触生成。
  • 在内容节点之间引入域内边,以在语义相似区域之间保持全局风格一致性的连贯性。
  • 使用归一化互相关(NCC)作为构建异质边的相似性度量,其性能优于欧氏距离。
  • 通过在推理阶段动态调整每个节点的连接数量,实现多样化风格化输出,使单一模型可生成多个独特结果。

实验结果

研究问题

  • RQ1可学习的、多对一的内容-风格图像块对应关系是否能减少非参数化风格迁移中因图像块错配导致的伪影?
  • RQ2GNN能否有效建模细粒度、自适应的内容-风格关系,以提升局部细节的保留效果?
  • RQ3可变形图卷积是否能实现跨尺度的内容-风格匹配,从而生成更自然且空间自适应的笔触?
  • RQ4通过控制推理阶段的连接性,单一GNN模型在多大程度上可生成多样化的风格化输出?
  • RQ5与欧氏距离相比,使用NCC作为相似性度量是否能提升图中内容-风格对应关系的质量?

主要发现

  • 所提出的基于GNN的方法在全局笔触布局与局部细粒度模式两方面均实现了优越的风格化性能,优于当前最先进的参数化与非参数化方法。
  • 使用归一化互相关(NCC)作为相似性度量显著优于欧氏距离,尤其在保留局部细节与全局一致性方面表现更优。
  • 可变形图卷积模块实现了空间自适应的多尺度笔触生成,增强了风格化输出的对比度与语义显著性。
  • 在内容节点之间引入域内边可提升全局一致性,尤其在语义相似区域(如眼睛与背景)中效果显著。
  • 通过在推理阶段调整每个节点的连接数量,模型可在单次前向传播中实现多样化、基于图像块的风格化输出,支持用户对风格变化的可控调节。
  • 更大的图像块尺寸可生成更大、更显著的笔触,表明对笔触尺度具有良好的可控性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。