Skip to main content
QUICK REVIEW

[论文解读] BargainNet: Background-Guided Domain Translation for Image Harmonization

Wenyan Cong, Li Niu|arXiv (Cornell University)|Sep 19, 2020
Image Enhancement Techniques参考文献 12被引用 5
一句话总结

BargainNet 提出了一种新颖的背景引导域迁移框架用于图像合成,其中域码提取器学习与背景相关的域码,通过 U-Net 生成器引导前景风格迁移。该方法使用定制的三元组损失确保域码的准确性,在 iHarmony4 数据集上达到最先进性能,并支持额外任务如不和谐程度预测。

ABSTRACT

Image composition is a fundamental operation in image editing field. However, unharmonious foreground and background downgrade the quality of composite image. Image harmonization, which adjusts the foreground to improve the consistency, is an essential yet challenging task. Previous deep learning based methods mainly focus on directly learning the mapping from composite image to real image, while ignoring the crucial guidance role that background plays. In this work, with the assumption that the foreground needs to be translated to the same domain as background, we formulate image harmonization task as background-guided domain translation. Therefore, we propose an image harmonization network with a novel domain code extractor and well-tailored triplet losses, which could capture the background domain information to guide the foreground harmonization. Extensive experiments on the existing image harmonization benchmark demonstrate the effectiveness of our proposed method. Code is available at https://github.com/bcmi/BargainNet.

研究动机与目标

  • 为解决现有图像合成方法忽视背景在风格对齐中引导作用的局限性。
  • 将图像合成重新形式化为背景引导的域迁移问题,将不同的拍摄条件视为不同的域。
  • 设计一种域码提取器,利用部分卷积技术提取背景域信息,避免前景内容的干扰。
  • 通过精心设计的三元组损失构建新型训练目标,确保域码反映真实的域差异,而非语义布局。
  • 通过提取的域码实现下游应用,如背景合成与不和谐程度预测。

提出的方法

  • 基于部分卷积的域码提取器可隔离背景特征,提取特定于域的码,最大限度减少前景泄漏。
  • 将背景域码进行空间上采样,并与前景掩码拼接,作为条件输入 U-Net 生成器以实现前景迁移。
  • 设计三元组损失,使背景码与真实前景码、合成前景码的距离更近,同时使合成前景码与复合前景码的距离更远。
  • 三元组损失强制满足以下六个约束:d(z_b, z_f) < d(z_b, z_f~),d(z_b, z_hat_f) < d(z_b, z_f~),以及 d(z_f, z_hat_f) < d(z_f, z_f~)。
  • 生成器采用注意力增强的 U-Net 架构,基于拼接的前景掩码与背景域码生成合成输出。
  • 模型在 iHarmony4 基准上端到端训练,结合对抗性损失与感知损失,以及所提出的三元组损失。

实验结果

研究问题

  • RQ1能否有效提取并利用背景域信息来引导图像合成中的前景风格迁移?
  • RQ2将图像合成形式化为背景引导的域迁移是否能带来优于先前方法的视觉与定量结果?
  • RQ3提取的域码能否用于预测合成图像的不和谐程度?
  • RQ4所提出的三元组损失在确保域码捕捉特定于域的特征而非语义布局方面有多有效?
  • RQ5通过反转掩码与码的角色,模型能否适应背景合成任务?

主要发现

  • 所提方法在 iHarmony4 基准上达到最先进性能,无论在定量还是定性评估中均优于现有方法,包括 DIH、S2AM 和 DoveNet。
  • 三元组损失显著提升了域码质量,训练三元组中 95.6% 满足全部六个约束,远超 DoveNet 的较低比例。
  • 在 99 张真实合成图像上的用户研究表明,BargainNet 在感知质量与真实感方面优于其他深度学习方法。
  • 通过反转掩码与码的角色,该方法可实现背景合成,证明其在仅调整前景之外的泛化能力。
  • 前景与背景域码之间的欧氏距离可作为可靠的不和谐程度预测指标,距离越大表示视觉不一致性越强。
  • 消融实验证实,若移除三元组损失,合成结果的一致性下降,证明其对有效域码学习的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。