Skip to main content
QUICK REVIEW

[论文解读] Guided Image-to-Image Translation with Bi-Directional Feature Transformation

Badour AlBahar, Jia‐Bin Huang|arXiv (Cornell University)|Oct 24, 2019
Advanced Vision and Imaging参考文献 38被引用 16
一句话总结

本文提出了一种用于引导图像到图像翻译的双向特征变换(bFT)方案,通过空间可变的、逐特征的仿射变换,在输入图像与引导图像之间实现互信息流动。该方法在姿态迁移、纹理迁移和深度上采样任务中均实现了最先进或具有竞争力的性能,优于如拼接、CIN 和 AdaIN 等单向条件化方法,在定量指标和用户研究中表现更优。

ABSTRACT

We address the problem of guided image-to-image translation where we translate an input image into another while respecting the constraints provided by an external, user-provided guidance image. Various conditioning methods for leveraging the given guidance image have been explored, including input concatenation , feature concatenation, and conditional affine transformation of feature activations. All these conditioning mechanisms, however, are uni-directional, i.e., no information flow from the input image back to the guidance. To better utilize the constraints of the guidance image, we present a bi-directional feature transformation (bFT) scheme. We show that our bFT scheme outperforms other conditioning schemes and has comparable results to state-of-the-art methods on different tasks.

研究动机与目标

  • 解决引导图像到图像翻译中单向条件化方法的局限性,即仅由引导图像影响输入图像。
  • 通过允许信息从输入图像反馈至引导图像,提升图像翻译的可控性和视觉质量。
  • 开发一种通用的、与应用无关的条件化机制,适用于多种引导类型(如姿态、纹理、深度、掩码)的泛化。
  • 通过使特征变换具有空间可变性,实现对输入图像与引导图像内容差异的局部自适应。
  • 在无需针对特定任务修改网络架构的前提下,验证所提方法在多个图像翻译任务中的有效性。

提出的方法

  • 提出一种双向特征变换(bFT)机制,双向应用逐特征仿射变换:从引导图像到输入图像,以及从输入图像到引导图像。
  • 引入空间可变的缩放与偏移参数用于特征变换,通过一个轻量级网络基于输入和引导特征联合计算。
  • 用 bFT 层替换 U-Net 构建的生成器中的标准归一化层,实现基于源图像和引导图像内容的动态特征图调制。
  • 使用共享特征提取器编码输入和引导图像,随后通过交叉注意力或逐元素交互生成调制参数。
  • 采用残差 U-Net 架构,在每个残差块中用 bFT 层替换批量归一化或实例归一化层。
  • 将 bFT 操作定义为:$ y = \gamma(x, g) \odot \text{BatchNorm}(x) + \beta(x, g) $,其中 $ \gamma $ 和 $ \beta $ 是从 $ x $(输入)和 $ g $(引导)预测出的空间可变参数。

实验结果

研究问题

  • RQ1输入图像与引导图像之间的双向信息流动是否能提升图像到图像翻译的质量与可控性?
  • RQ2与空间不变的方法相比,空间可变的特征变换是否能带来更优的定位性与引导信号适应性?
  • RQ3在定量指标和用户偏好方面,所提出的 bFT 方案相较于现有条件化机制(如拼接、CIN、AdaIN)表现如何?
  • RQ4一个单一的、通用的 bFT 模型是否能在无需任务特定网络结构修改的前提下,实现多种引导翻译任务的竞争力表现?
  • RQ5在性能与效率之间取得平衡时,网络中 bFT 层的最佳数量与位置是什么?

主要发现

  • 所提出的 bFT 方法在 16 倍深度上采样任务中取得 13.240 的 FID,优于输入拼接(FID: 11.86)、特征拼接(FID: 11.59)和单向 FT(FID: 13.988)。
  • 在姿态迁移任务中,bFT 实现 SSIM 0.767 和 FID 13.240,显著优于单向 FT(SSIM: 0.765,FID: 13.988)和输入拼接(SSIM: 0.782,FID: 42.330)。
  • 在纹理迁移任务中,bFT 实现 FID 58.467 和 LPIPS 0.067,优于输入拼接(FID: 60.795,LPIPS: 0.061)和特征拼接(FID: 44.900,LPIPS: 0.085)。
  • 用户研究表明,85.6% 的参与者更倾向于 bFT 生成的图像,认为其更具真实感且与引导更匹配。
  • 消融实验表明,在全部四个残差块中使用 bFT 可获得最佳性能,深度上采样任务中 FID 为 13.240,而单向 FT 的 FID 为 13.988。
  • 将最后一层归一化层替换为 bFT 可获得更优结果(FID: 13.240),优于在最后一层使用 CIN 或 AdaIN(FID 分别为 157.335 和 168.503),证明了所提 bFT 设计的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。