Skip to main content
QUICK REVIEW

[论文解读] Generate and Edit Your Own Character in a Canonical View

Jeong-gi Kwak, Yuanming Li|arXiv (Cornell University)|May 6, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

该论文提出了一种统一的、无需3D监督的框架,通过在StyleGAN的潜在空间中进行操作,生成并编辑以标准正前方视角呈现的风格化肖像。通过在基于NeRF的GAN生成的伪真实配对数据上训练新型潜在映射器,该方法实现了同时的风格化与正前方化,其视觉质量、身份保留度和推理速度均优于级联方法,FID达到65.21,推理时间仅0.26秒。

ABSTRACT

Recently, synthesizing personalized characters from a single user-given portrait has received remarkable attention as a drastic popularization of social media and the metaverse. The input image is not always in frontal view, thus it is important to acquire or predict canonical view for 3D modeling or other applications. Although the progress of generative models enables the stylization of a portrait, obtaining the stylized image in canonical view is still a challenging task. There have been several studies on face frontalization but their performance significantly decreases when input is not in the real image domain, e.g., cartoon or painting. Stylizing after frontalization also results in degenerated output. In this paper, we propose a novel and unified framework which generates stylized portraits in canonical view. With a proposed latent mapper, we analyze and discover frontalization mapping in a latent space of StyleGAN to stylize and frontalize at once. In addition, our model can be trained with unlabelled 2D image sets, without any 3D supervision. The effectiveness of our method is demonstrated by experimental results.

研究动机与目标

  • 解决从任意角度输入图像生成标准正前方视角风格化肖像而无需3D监督的挑战。
  • 克服级联方法中先正前方化后风格化导致的身份和视觉质量退化问题。
  • 发现一种准确的潜在空间映射以实现StyleGAN潜在空间中的正前方化,同时保留语义流形。
  • 仅使用未标注的2D图像集合,实现端到端的风格化与正前方化,避免依赖3DMM或姿态估计器。
  • 保持与现有基于StyleGAN的潜在空间编辑技术的兼容性,以支持下游编辑操作。

提出的方法

  • 从零开始训练一种基于NeRF的GAN,以生成随机视角与正前方视角图像的伪真实配对数据,为潜在映射提供监督信号。
  • 引入一种新型潜在映射器,以学习从任意视角潜在码到StyleGAN潜在空间中标准正前方视角潜在码的准确映射。
  • 通过结合L1损失、感知损失和身份保持损失的多损失目标函数训练潜在映射器,以确保输出的保真度与真实感。
  • 通过GAN插值实现风格化,其中经过操纵的潜在码仅影响StyleGAN生成器的早期层,以保留身份与质量。
  • 整个方法完全在潜在空间中运行,可直接应用现有潜在空间编辑技术(如InterFaceGAN)进行属性操纵。
  • 该框架在未标注的2D图像集合上端到端训练,无需依赖标注的关键点、3D网格或预训练的3D模型。

实验结果

研究问题

  • RQ1是否能够通过统一框架在无需3D监督或标注标签的情况下,生成标准正前方视角的风格化肖像?
  • RQ2如何在不依赖3D几何或姿态估计的前提下,在StyleGAN的潜在空间中实现准确的正前方化?
  • RQ3在单步中联合执行风格化与正前方化是否优于级联流程(如先正前方化再风格化)在视觉质量与身份保留方面的表现?
  • RQ4该方法在多种风格化领域中,能够在多大程度上保持身份与语义一致性?
  • RQ5该方法是否能够无缝集成至现有潜在空间编辑技术中,以实现在标准视角下的属性操纵?

主要发现

  • 所提方法实现了65.21的Fréchet Inception Distance(FID),显著优于级联方法(分别为95.25和86.64),在视觉质量上表现更优。
  • 该方法推理速度最快,每张输出仅需0.26秒,优于级联方法(1.84秒和4.63秒),支持实时应用。
  • 该方法在身份保留方面优于级联流程,在ArcFace度量下实现了82.26的身份得分,比次优方法(77.10)高出15.5%。
  • 定性结果表明,该方法在保真度与身份一致性方面表现优越,即使在卡通和绘画等风格化输入下也无可见伪影或失真。
  • 该方法成功实现了通过InterFaceGAN在标准视角中对语义属性(如年龄、性别、微笑)进行编辑,证明其与现有潜在空间编辑工具的兼容性。
  • 消融研究证实,潜在映射器的设计至关重要,若移除其结构,将导致身份与视觉质量的显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。