Skip to main content
QUICK REVIEW

[论文解读] A Free Viewpoint Portrait Generator with Dynamic Styling.

Anpei Chen, Ruiyang Liu|arXiv (Cornell University)|Jul 7, 2020
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 5
一句话总结

本文提出了一种自由视角人像生成器,通过使用语义占据场(SOF)实现几何与纹理空间的解耦,以实现3D感知的形状表征,并利用语义实例级(SIW)StyleGAN实现区域风格控制。通过在664个3D人像扫描数据和真实图像(FFHQ/CelebA-HQ)上进行训练,该方法实现了姿态、视角和区域风格的解耦且外观一致的编辑,实现了在可控性和泛化能力方面的最先进性能。

ABSTRACT

Generating portrait images from a single latent space facing the problem of entangled attributes, making it difficult to explicitly adjust the generation on specific attributes, e.g., contour and viewpoint control or dynamic styling. Therefore, we propose to decompose the generation space into two subspaces: geometric and texture space. We first encode portrait scans with a semantic occupancy field (SOF), which represents semantic-embedded geometry structure and output free-viewpoint semantic segmentation maps. Then we design a semantic instance wised(SIW) StyleGAN to regionally styling the segmentation map. We capture 664 3D portrait scans for our SOF training and use real capture photos(FFHQ and CelebA-HQ) for SIW StyleGAN training. Adequate experiments show that our representations enable appearance consistent shape, pose, regional styles controlling, achieve state-of-the-art results, and generalize well in various application scenarios.

研究动机与目标

  • 为解决单隐空间人像生成中属性纠缠的问题,该问题限制了对几何与风格的显式控制。
  • 通过建模3D感知的语义几何,实现在不同视角下外观一致的自由视角生成。
  • 通过将纹理操作与几何结构解耦,实现区域风格编辑。
  • 训练一个鲁棒的人像生成系统,使其在多种应用场景中具有良好的泛化能力。

提出的方法

  • 在664个3D人像扫描数据上训练语义占据场(SOF),以表征嵌入语义的3D几何,并生成自由视角的语义分割图。
  • 使用真实人像照片(FFHQ和CelebA-HQ)训练语义实例级(SIW)StyleGAN,对分割图应用区域特定的风格迁移。
  • 将生成空间分解为两个子空间:通过SOF实现几何空间,通过SIW StyleGAN实现纹理空间,以实现解耦控制。
  • 将输入扫描编码为SOF,生成3D结构化的语义图,再利用具有实例感知的潜在码通过SIW StyleGAN进行风格化处理。
  • 利用SOF的3D一致性,在保持外观保真度的同时实现视角和姿态的变化。
  • 结合SOF的几何表征与SIW StyleGAN的区域风格调制,实现细粒度、可控的人像生成。

实验结果

研究问题

  • RQ1解耦的几何与纹理表征是否能实现对人像生成中视角和轮廓的显式控制?
  • RQ2在StyleGAN框架中,使用实例级潜在码进行区域风格编辑的效率如何?
  • RQ3基于SOF的几何表征在自由视角下对形状一致性的保持程度如何?
  • RQ4与先前方法相比,该方法在多样化的人像生成场景中的泛化能力如何?

主要发现

  • 所提方法在自由视角人像生成中实现了最先进性能,可显式控制姿态和视角。
  • 由于采用了3D感知的SOF语义几何表征,不同视角下的外观一致性显著提升。
  • 通过SIW StyleGAN有效实现了区域风格编辑,可对发色或衣物纹理等属性进行局部操控。
  • 该模型在多种应用场景中表现出良好的泛化能力,包括未见姿态和光照条件。
  • 结合664个3D扫描数据用于SOF训练和真实图像(FFHQ/CelebA-HQ)用于SIW训练,实现了高保真、可控的生成效果。
  • 定量与定性结果表明,与基线方法相比,本方法在解耦性和编辑能力方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。