[论文解读] Arbitrary Style Transfer with Deep Feature Reshuffle
本文提出了一种新颖的神经风格迁移方法,通过深度特征重排统一全局与局部风格建模,实现高质量、语义一致的风格迁移。通过根据内容对风格图像的特征进行重排,该方法在保持全局外观保真度的同时实现局部纹理的合理性,其在质量与感知偏好方面优于以往的参数化与非参数化方法。
This paper introduces a novel method by reshuffling deep features (i.e., permuting the spacial locations of a feature map) of the style image for arbitrary style transfer. We theoretically prove that our new style loss based on reshuffle connects both global and local style losses respectively used by most parametric and non-parametric neural style transfer methods. This simple idea can effectively address the challenging issues in existing style transfer methods. On one hand, it can avoid distortions in local style patterns, and allow semantic-level transfer, compared with neural parametric methods. On the other hand, it can preserve globally similar appearance to the style image, and avoid wash-out artifacts, compared with neural non-parametric methods. Based on the proposed loss, we also present a progressive feature-domain optimization approach. The experiments show that our method is widely applicable to various styles, and produces better quality than existing methods.
研究动机与目标
- 解决现有神经风格迁移方法的局限性,这些方法或导致局部纹理失真(参数化方法),或引入泛白伪影(非参数化方法)。
- 通过一种新颖的特征重排机制,将参数化与非参数化方法的优势统一,连接全局与局部风格损失。
- 开发一种高效、渐进式的特征域优化框架,以提升风格化质量并降低计算成本。
- 实现任意风格迁移,同时更好地保留全局风格外观与局部语义结构。
提出的方法
- 提出一种基于深度特征重排的新风格损失,通过空间置换特征图位置来强制实现全局与局部风格一致性。
- 从理论上证明特征重排等价于优化格拉姆矩阵,将该方法与参数化风格迁移建立联系。
- 引入一种渐进式、基于金字塔的特征域优化策略,从高层到低层逐步恢复特征,并使用学习到的解码器重建图像。
- 应用受约束的最近邻(NN)场搜索,并引入补丁使用参数 λ 以限制重复性,避免泛白伪影。
- 通过加权损失函数平衡内容与风格,其中 α = 0.5 和 β = 1.0 以实现一致的风格化水平。
- 在特征域而非图像域中优化能量函数,从而提升效率与收敛性。
实验结果
研究问题
- RQ1深度特征重排能否统一参数化与非参数化神经风格迁移中使用的全局与局部风格建模目标?
- RQ2特征域优化策略能否在保持效率的同时,实现优于图像域优化的风格化质量?
- RQ3所提方法是否能比现有最先进方法更好地保留全局外观与局部语义结构?
- RQ4重排约束能否减少非参数化方法中因重复补丁采样导致的泛白伪影?
- RQ5与先前的神经风格迁移方法相比,该方法在感知质量与计算成本方面表现如何?
主要发现
- 所提方法在感知质量方面表现卓越,在用户研究中平均排名得分为 2.88,优于所有对比方法。
- 结果表明,该方法在保留局部纹理模式与语义级迁移(如眼对眼、嘴对嘴)方面优于参数化方法,如 Gatys et al. [16] 和 Huang et al. [20]。
- 由于通过重排机制对补丁使用施加约束,该方法避免了非参数化方法(如 Liao et al. [32] 和 Li et al. [28])中常见的泛白伪影。
- 在速度方面,该方法与 Liao et al. [32](114s)相当,快于 Gatys et al. [16](370s),且显著快于 Li et al. [28](195s)。
- 结合学习解码器的渐进式特征域优化,实现了高效风格化,减少了对耗时的图像域优化的需求。
- 该方法在多样化的内容与风格配对中具有良好的泛化能力,已在公开数据集及 Ostagram 网站的 100 多组图像对上得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。