Skip to main content
QUICK REVIEW

[论文解读] StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGAN

Fei Yin, Yong Zhang|arXiv (Cornell University)|Mar 8, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出StyleHEAT,一种统一框架,用于使用预训练的StyleGAN实现单张图像驱动的高分辨率(1024×1024)可编辑对话人脸生成。该方法利用学习到的潜在空间特性,结合视频/音频驱动的运动生成模块,通过校准网络纠正形变伪影,并引入领域损失以优化特征,从而实现解耦控制与灵活编辑,且无需依赖高分辨率训练数据。

ABSTRACT

One-shot talking face generation aims at synthesizing a high-quality talking face video from an arbitrary portrait image, driven by a video or an audio segment. One challenging quality factor is the resolution of the output video: higher resolution conveys more details. In this work, we investigate the latent feature space of a pre-trained StyleGAN and discover some excellent spatial transformation properties. Upon the observation, we explore the possibility of using a pre-trained StyleGAN to break through the resolution limit of training datasets. We propose a novel unified framework based on a pre-trained StyleGAN that enables a set of powerful functionalities, i.e., high-resolution video generation, disentangled control by driving video or audio, and flexible face editing. Our framework elevates the resolution of the synthesized talking face to 1024*1024 for the first time, even though the training dataset has a lower resolution. We design a video-based motion generation module and an audio-based one, which can be plugged into the framework either individually or jointly to drive the video generation. The predicted motion is used to transform the latent features of StyleGAN for visual animation. To compensate for the transformation distortion, we propose a calibration network as well as a domain loss to refine the features. Moreover, our framework allows two types of facial editing, i.e., global editing via GAN inversion and intuitive editing based on 3D morphable models. Comprehensive experiments show superior video quality, flexible controllability, and editability over state-of-the-art methods.

研究动机与目标

  • 解决仅凭单张肖像图生成高分辨率(1024×1024)对话人脸视频的挑战,尽管训练数据仅限于低分辨率。
  • 通过利用预训练StyleGAN的潜在空间而非从零开始训练,克服单张图像对话人脸生成中的分辨率瓶颈。
  • 通过视频或音频驱动信号实现对运动的解耦控制,实现灵活且可控的动画生成。
  • 同时支持通过GAN反演进行全局面部属性编辑,以及在视频生成过程中使用3D形态可塑模型(3DMM)实现直观编辑。
  • 通过专用校准网络与领域损失,最小化运动迁移过程中特征形变带来的视觉伪影。

提出的方法

  • 利用预训练StyleGAN的潜在特征空间,通过对潜在码施加空间变换生成高分辨率人脸,从而避免对高分辨率训练数据的依赖。
  • 设计基于视频的运动生成模块,从驱动视频帧中预测3DMM参数,并将其映射为潜在空间的变换。
  • 实现基于音频的运动生成模块,将音频特征映射为3DMM参数,以实现唇形同步与表情控制。
  • 引入校准网络,对形变后的潜在特征进行精细化处理,以纠正眼睛和嘴角区域的失真伪影。
  • 应用领域损失,将校准后的特征约束在原始StyleGAN分布内,以保持身份一致性和纹理保真度。
  • 支持两种编辑范式:通过GAN反演实现全局属性编辑(如年龄、妆容),以及通过3DMM实现直观的姿态/表情控制。

实验结果

研究问题

  • RQ1能否利用预训练StyleGAN的潜在空间,在无需高分辨率训练数据的情况下生成1024×1024的对话人脸视频?
  • RQ2如何实现从视频或音频中解耦运动信息,并将其应用于潜在空间以实现一致的面部动画?
  • RQ3在高分辨率生成过程中,哪些机制能有效纠正潜在空间变换导致的形变伪影?
  • RQ4通过GAN反演进行全局属性编辑在多大程度上能保持运动质量与身份一致性?
  • RQ5能否在高分辨率、单张图像驱动的对话人脸框架中有效集成基于3DMM参数的直观编辑?

主要发现

  • StyleHEAT首次实现了1024×1024分辨率的单张图像对话人脸生成,显著超越此前仅限于512×512或更低分辨率的最先进方法。
  • 校准网络有效减少了眼睛和嘴角区域的可见伪影,实现了闭眼和牙齿的正确生成,而这些在基线形变方法中常出现失真。
  • 领域损失通过防止过度正则化提升了视觉质量,减少了模糊感,同时保留了皱纹和发丝纹理等精细细节。
  • 通过GAN反演实现的全局编辑可成功修改胡须、妆容和年龄等属性,且不影响运动迁移,保持了时间一致性。
  • 基于3DMM参数的直观编辑实现了更一致的姿态与表情控制,且在纹理与光照保真度方面优于基于3DMM的基线方法(如PIRenderer)。
  • 消融实验证实,校准网络与领域损失对高保真结果至关重要,其移除将导致质量与真实感显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。