Skip to main content
QUICK REVIEW

[论文解读] Texture Reformer: Towards Fast and Universal Interactive Texture Transfer

Zhizhong Wang, Lei Zhao|arXiv (Cornell University)|Dec 6, 2021
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出 Texture Reformer,一种快速且通用的神经框架,用于使用用户指定的语义图进行交互式纹理迁移。它采用前馈、多视角、多阶段的合成流水线,结合视角特定的纹理重构(VSTR)与基于统计的增强技术,实现高质量、结构保持的结果,推理速度比最先进方法快 2–5 个数量级。

ABSTRACT

In this paper, we present the texture reformer, a fast and universal neural-based framework for interactive texture transfer with user-specified guidance. The challenges lie in three aspects: 1) the diversity of tasks, 2) the simplicity of guidance maps, and 3) the execution efficiency. To address these challenges, our key idea is to use a novel feed-forward multi-view and multi-stage synthesis procedure consisting of I) a global view structure alignment stage, II) a local view texture refinement stage, and III) a holistic effect enhancement stage to synthesize high-quality results with coherent structures and fine texture details in a coarse-to-fine fashion. In addition, we also introduce a novel learning-free view-specific texture reformation (VSTR) operation with a new semantic map guidance strategy to achieve more accurate semantic-guided and structure-preserved texture transfer. The experimental results on a variety of application scenarios demonstrate the effectiveness and superiority of our framework. And compared with the state-of-the-art interactive texture transfer algorithms, it not only achieves higher quality results but, more remarkably, also is 2-5 orders of magnitude faster. Code is available at https://github.com/EndyWon/Texture-Reformer.

研究动机与目标

  • 解决现有交互式纹理迁移方法的局限性,这些方法因迭代优化和计算密集型 CPU 操作而速度缓慢。
  • 将多样化的纹理迁移任务——如涂鸦转艺术、图案编辑、文字效果迁移和虚拟试穿——统一在一个单一、通用的框架下。
  • 在显著提升推理速度的同时,实现高质量结果,保持结构一致性和精细纹理细节。
  • 开发一种无需学习的前馈架构,实现无需为每张输入重新训练的实时用户交互。

提出的方法

  • 该框架采用粗到精的三阶段合成流水线:全局结构对齐、局部纹理优化和整体效果增强。
  • 提出一种新颖的视角特定纹理重构(VSTR)操作,利用语义图引导,在无需学习的情况下保留结构并改善对齐。
  • VSTR 分两个阶段运行:首先全局视角捕获并对齐源纹理结构,然后局部视角优化细节。
  • 在最终阶段应用基于统计的增强(SE)操作,以改善色彩、亮度和对比度等低级效果。
  • 整个流水线使用预训练的自编码器实现,推理过程中无需反向传播或优化。
  • 该方法具有通用性和高效性,因为 VSTR 和 SE 均无需学习,且网络为前馈结构,可在 CPU 或 GPU 上实现实时性能。

实验结果

研究问题

  • RQ1能否构建一个无需依赖迭代优化或学习型优化的通用、快速且高质量的交互式纹理迁移框架?
  • RQ2如何有效利用细节最少的语义图(如涂鸦)来引导精确的纹理迁移,同时保持局部结构?
  • RQ3前馈式多阶段架构在速度和质量方面,能在多大程度上超越现有的基于优化的方法?
  • RQ4像 VSTR 这类无需学习的操作,能否在结构保持和语义对齐方面优于可微分的、基于学习的替代方案?

主要发现

  • 所提方法的推理速度比最先进方法快 2–5 个数量级,256×256 图像的推理时间在 GPU 上为 0.232 秒,在 CPU 上为 2.573 秒。
  • 在 512×512 分辨率下,该方法在 GPU 上耗时 0.956 秒,在 CPU 上耗时 12.381 秒,显著优于 T-Effect 和 CFITT 等竞争方法。
  • 用户研究结果显示,32.1% 的参与者更偏好 Texture Reformer 的结果,优于 T-Effect(23.8%)、CFITT(26.2%)、Neural Doodle(10.3%)和 STROTSS(7.6%)。
  • 该方法在感知质量方面表现更优,LPIPS 和风格损失更低,表明其能更好地保留源纹理结构和整体风格。
  • 该框架在多种任务中均表现稳健,包括涂鸦转艺术、图案编辑、文字效果迁移和虚拟试穿,展现出通用适用性。
  • 尽管方法简单,但性能出色,无需对每张图像重新训练或进行复杂优化,非常适合交互式应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。