Skip to main content
QUICK REVIEW

[论文解读] Barbershop: GAN-based Image Compositing using Segmentation Masks

Peihao Zhu, Rameen Abdal|arXiv (Cornell University)|Jun 2, 2021
Generative Adversarial Networks and Image Synthesis参考文献 46被引用 12
一句话总结

Barbershop 提出了一种基于 GAN 的图像合成框架,通过结合 W+ 风格代码与结构张量的新型潜在空间,实现了高保真度、全局一致的发型迁移。通过将参考图像对齐至同一语义分割掩码并嵌入此增强的潜在空间,该方法在用户偏好测试中以 95% 的得分超越现有最先进方法,显著减少了伪影并保留了细小细节(如皱纹和痣)。

ABSTRACT

Seamlessly blending features from multiple images is extremely challenging because of complex relationships in lighting, geometry, and partial occlusion which cause coupling between different parts of the image. Even though recent work on GANs enables synthesis of realistic hair or faces, it remains difficult to combine them into a single, coherent, and plausible image rather than a disjointed set of image patches. We present a novel solution to image blending, particularly for the problem of hairstyle transfer, based on GAN-inversion. We propose a novel latent space for image blending which is better at preserving detail and encoding spatial information, and propose a new GAN-embedding algorithm which is able to slightly modify images to conform to a common segmentation mask. Our novel representation enables the transfer of the visual properties from multiple reference images including specific details such as moles and wrinkles, and because we do image blending in a latent-space we are able to synthesize images that are coherent. Our approach avoids blending artifacts present in other approaches and finds a globally consistent image. Our results demonstrate a significant improvement over the current state of the art in a user study, with users preferring our blending solution over 95 percent of the time.

研究动机与目标

  • 解决无缝图像合成的挑战,特别是发型迁移问题,其中光照、几何结构和遮挡导致图像区域之间存在强烈依赖关系。
  • 克服现有基于 GAN 的编辑方法因源区域与目标区域语义错位而导致结果断裂或不一致的局限性。
  • 开发一种潜在空间表征,以在保持空间结构和细粒度细节的同时,实现在多个图像源之间的连贯融合。
  • 使用户能够将多个参考图像中的外观属性(如发色、纹理)和结构属性(如发型形状、姿态)整合到一张逼真的合成图像中。
  • 实现光照、阴影和面部几何结构的全局一致性,以生成逼真且避免常见伪影(如不自然边界或遮挡缺失问题)的图像。

提出的方法

  • 提出一种新型潜在空间 $FS$,将标准的 W+ 潜在代码与学习得到的结构张量相结合,以增强空间感知能力并保留细粒度的面部细节。
  • 提出一种 GAN 嵌入算法,通过优化图像使其与参考图像相似,同时微妙地修改其以符合目标分割掩码,确保语义对齐。
  • 利用 $FS$ 潜在空间将多张参考图像(如人脸、背景、发型)嵌入至共享表征中,同时保持身份一致性和结构一致性。
  • 通过在 $FS$ 空间中混合嵌入的潜在代码实现图像合成,利用 GAN 的生成先验来合成连贯且高分辨率的输出图像。
  • 在嵌入过程中应用损失函数,平衡重建保真度、身份保留和掩码合规性,结合感知损失与 L2 损失。
  • 采用 StyleGAN-ADA 作为基础生成器,以在保持内容与风格属性解耦的同时实现高质量的图像合成。

实验结果

研究问题

  • RQ1经过修改的潜在空间表征是否能显著提升基于 GAN 的图像合成在保真度和空间连贯性方面的表现,特别是在头发等复杂属性上?
  • RQ2通过语义分割掩码实现的对齐在图像区域融合质量与真实感方面,相较于无约束融合有何影响?
  • RQ3GAN 嵌入算法在符合新分割掩码的同时,能在多大程度上保留细粒度细节(如痣、皱纹)?
  • RQ4在具备空间感知能力的潜在空间中进行融合,是否能有效减少如不自然边界、光照不匹配或遮挡缺失等常见伪影?
  • RQ5在真实世界编辑任务中,该方法与现有最先进方法相比,在用户偏好和感知质量方面表现如何?

主要发现

  • 与标准 W+ 潜在空间相比,所提出的 $FS$ 潜在空间在细节保留和空间一致性方面有显著提升,尤其在面部特征和发型结构方面表现优异。
  • GAN 嵌入算法成功地将参考图像修改为与目标分割掩码对齐,同时保持了高感知质量与身份保真度。
  • 在受控用户研究中,该合成流程在用户偏好测试中以 95% 的得分超越现有最先进方法,证明其具有显著的感知优势。
  • 通过强制实施语义与结构对齐,该方法有效减少了混合伪影,如硬过渡、不自然光照和遮挡缺失问题。
  • 该方法在处理非重叠掩码和视角不匹配等复杂情况时优于以往工作,尽管在极端几何畸变情况下仍存在一些局限性。
  • 失败案例包括对代表性不足特征(如珠宝)的重建效果较差,以及在处理细小透明发丝或掩码错位时存在挑战,表明未来仍有优化空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。