Skip to main content
QUICK REVIEW

[论文解读] DoveNet: Deep Image Harmonization via Domain Verification

Wenyan Cong, Jianfu Zhang|arXiv (Cornell University)|Nov 27, 2019
Generative Adversarial Networks and Image Synthesis参考文献 9被引用 12
一句话总结

本文提出DoveNet,一种用于图像合成的深度学习方法,通过引入一种新颖的领域验证判别器,将合成图像中前景域与背景域对齐。该方法在新构建的大规模数据集iHarmony4上实现了最先进性能,该数据集通过从COCO、Adobe5k、Flickr和day2night数据集合成具有严格质量与真实感筛选的逼真合成图像构建而成。

ABSTRACT

Image composition is an important operation in image processing, but the inconsistency between foreground and background significantly degrades the quality of composite image. Image harmonization, aiming to make the foreground compatible with the background, is a promising yet challenging task. However, the lack of high-quality publicly available dataset for image harmonization greatly hinders the development of image harmonization techniques. In this work, we contribute an image harmonization dataset iHarmony4 by generating synthesized composite images based on COCO (resp., Adobe5k, Flickr, day2night) dataset, leading to our HCOCO (resp., HAdobe5k, HFlickr, Hday2night) sub-dataset. Moreover, we propose a new deep image harmonization method DoveNet using a novel domain verification discriminator, with the insight that the foreground needs to be translated to the same domain as background. Extensive experiments on our constructed dataset demonstrate the effectiveness of our proposed method. Our dataset and code are available at https://github.com/bcmi/Image_Harmonization_Datasets.

研究动机与目标

  • 为解决现有图像合成数据集中真实感不足和多样性有限的问题,这些缺陷阻碍了鲁棒深度学习模型的训练。
  • 通过从具有可控前景-背景不一致性的真实图像中合成合成图像,构建一种数据高效但质量高的训练流程。
  • 提出一种新型深度图像合成方法DoveNet,通过对抗性领域验证显式对齐前景域与背景域。
  • 构建并发布iHarmony4,一个大规模、多样化且高质量的图像合成数据集,包含四个子数据集:HCOCO、HAdobe5k、HFlickr和Hday2night。
  • 通过在数据集筛选过程中剔除不具代表性、不真实或语义无效的合成图像,提升合成图像的泛化能力与真实感。

提出的方法

  • 通过使用前景分割和自动色彩迁移技术,从COCO、Adobe5k、Flickr和day2night数据集中的真实图像中合成合成图像,构建新的图像合成数据集iHarmony4。
  • 通过人工筛选去除低质量合成图像,包括被遮挡的物体、不真实的色彩变化以及异常变化(如灯光突然亮起),以确保数据集质量。
  • 提出DoveNet,一种基于GAN的合成模型,其包含一个领域验证判别器,将真实图像中配对的前景与背景特征视为正样本对,将合成图像中的配对视为负样本对。
  • 训练领域验证判别器以区分前景与背景是否来自同一领域(真实图像)或不同领域(合成图像),从而促进领域对齐。
  • 采用结合感知损失、对抗损失和重建损失的多损失训练目标,在保留内容的同时实现颜色与光照的和谐统一。
  • 利用图像合成等价于领域自适应的洞察:在不使用显式领域标签的情况下,将前景翻译以匹配背景的领域分布。

实验结果

研究问题

  • RQ1能否构建一个合成的、大规模且高质量的图像合成数据集,以克服现有数据集在多样性与真实感方面的局限?
  • RQ2在无需显式领域标签的情况下,领域验证判别器是否能有效学习对齐合成图像中前景与背景的领域分布?
  • RQ3所提出的DoveNet模型在合成与真实合成图像上,是否在定量指标与定性视觉结果方面均优于现有最先进方法?
  • RQ4该模型在不同语义类别上的泛化能力如何,特别是对于具有高类内差异的类别(如“person”)?
  • RQ5对合成图像进行人工筛选在多大程度上提升了训练数据的质量与可靠性,以及下游模型的性能?

主要发现

  • 所提出的iHarmony4数据集,包含HCOCO、HAdobe5k、HFlickr和Hday2night四个子数据集,为图像合成提供了大规模、多样化且高质量的基准。
  • 在HCOCO子数据集上,DoveNet在fMSE(前景均方误差)方面取得显著提升,其中在“mouse”类别上最大降低1,141.57,在“keyboard”类别上降低1,058.59。
  • 在具有高类内差异的“person”类别上,DoveNet仍实现显著的fMSE降低437.32,表明其在复杂变化下仍具鲁棒性。
  • 在99张真实合成图像上的用户研究与定性结果表明,DoveNet生成的图像在视觉自然度与和谐度方面优于现有方法(如DIH、S2AM和Xue et al.)。
  • 领域验证判别器有效学习到对齐前景与背景领域,证据在于判别器能以高准确率区分真实(正样本)与合成(负样本)配对。
  • 人工筛选显著提升了数据集质量,通过剔除包含不真实变化(如灯光突然亮起、雪突然出现)或语义无意义对象(如部分被遮挡的人)的合成图像,从而带来更可靠的训练与更优的模型性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。