Skip to main content
QUICK REVIEW

[논문 리뷰] StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGAN

Fei Yin, Yong Zhang|arXiv (Cornell University)|2022. 03. 08.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 사전 훈련된 StyleGAN을 사용하여 1024×1024 해상도의 일회성 편집 가능한 대화하는 얼굴 생성을 위한 통합 프레임워크인 StyleHEAT를 제안한다. 이는 학습된 잠재 공간 성질, 비디오/오디오 주도 동작 생성기, 왜곡 아티팩트를 보정하기 위한 校정 네트워크, 및 특징 정제를 위한 도메인 손실을 활용하며, 고해상도 훈련 데이터가 필요 없이도 분리 제어와 민첩한 편집을 가능하게 한다.

ABSTRACT

One-shot talking face generation aims at synthesizing a high-quality talking face video from an arbitrary portrait image, driven by a video or an audio segment. One challenging quality factor is the resolution of the output video: higher resolution conveys more details. In this work, we investigate the latent feature space of a pre-trained StyleGAN and discover some excellent spatial transformation properties. Upon the observation, we explore the possibility of using a pre-trained StyleGAN to break through the resolution limit of training datasets. We propose a novel unified framework based on a pre-trained StyleGAN that enables a set of powerful functionalities, i.e., high-resolution video generation, disentangled control by driving video or audio, and flexible face editing. Our framework elevates the resolution of the synthesized talking face to 1024*1024 for the first time, even though the training dataset has a lower resolution. We design a video-based motion generation module and an audio-based one, which can be plugged into the framework either individually or jointly to drive the video generation. The predicted motion is used to transform the latent features of StyleGAN for visual animation. To compensate for the transformation distortion, we propose a calibration network as well as a domain loss to refine the features. Moreover, our framework allows two types of facial editing, i.e., global editing via GAN inversion and intuitive editing based on 3D morphable models. Comprehensive experiments show superior video quality, flexible controllability, and editability over state-of-the-art methods.

연구 동기 및 목표

  • 하나의 포트레이트 이미지에서 고해상도(1024×1024) 대화하는 얼굴 영상을 생성하는 데 도전하는 문제를 해결한다. 이는 훈련 데이터가 낮은 해상도로 제한되어 있음에도 불구하고.
  • 사전 훈련된 StyleGAN의 잠재 공간을 활용하여 일회성 대화하는 얼굴 생성에서 발생하는 해상도 제한 문제를 해결하며, 초기 훈련에서부터 시작하는 것이 아니라.
  • 비디오 또는 오디오 주도 신호를 통해 운동에 대한 분리 제어를 가능하게 하여 민감하고 제어 가능한 애니메이션을 제공한다.
  • GAN 역전환을 통한 전반적인 얼굴 속성 편집과 영상 생성 중 3D 모러블 모델(3DMM)을 사용한 직관적인 편집을 모두 지원한다.
  • 운동 전달 중 발생하는 특징 왜곡에서 기인하는 시각적 아티팩트를 줄이기 위해 전용 校정 네트워크와 도메인 손실을 활용한다.

제안 방법

  • 고해상도 얼굴 생성을 위해 사전 훈련된 StyleGAN의 잠재 특징 공간을 활용하며, 잠재 코드에 공간 변환을 적용함으로써 고해상도 훈련 데이터가 필요 없이도 생성 가능하도록 한다.
  • 주도 비디오 프레임에서 3DMM 파라미터를 예측하고 이를 잠재 공간 변환으로 매핑하는 비디오 기반 운동 생성 모듈을 설계한다.
  • 오디오 특징을 3DMM 파라미터로 매핑하는 오디오 기반 운동 생성 모듈을 구현하여 입술 동기화 및 표정 제어를 가능하게 한다.
  • 왜곡된 잠재 특징을 보정하기 위해 왜곡된 특징을 보정하는 전용 校정 네트워크를 도입하며, 특히 눈과 입 주변의 왜곡을 보정한다.
  • 보정된 특징이 원래 StyleGAN 분포 내에 유지되도록 도메인 손실을 적용하여 정체성과 질감의 정밀도를 유지한다.
  • 두 가지 편집 파라다임을 지원한다: GAN 역전환을 통한 전반적 속성 편집(예: 나이, 메이크업)과 3DMM 기반 조작을 통한 직관적인 자세/표정 제어.

실험 결과

연구 질문

  • RQ1사전 훈련된 StyleGAN의 잠재 공간을 활용하여 고해상도 훈련 데이터가 없이도 1024×1024 대화하는 얼굴 영상을 생성할 수 있는가?
  • RQ2비디오 또는 오디오에서 유도된 운동을 어떻게 분리하여 잠재 공간에 적용하여 일관된 얼굴 애니메이션을 구현할 수 있는가?
  • RQ3고해상도 생성에서 잠재 공간 변환 중 발생하는 왜곡 유발 아티팩트를 보정하는 데 효과적인 메커니즘은 무엇인가?
  • RQ4GAN 역전환을 통한 전반적 속성 편집은 운동 품질과 정체성을 유지하면서 얼마나 효과적으로 얼굴 속성을 수정할 수 있는가?
  • RQ53DMM 파라미터를 통한 직관적 편집은 고해상도, 일회성 대화하는 얼굴 프레임워크에 효과적으로 통합될 수 있는가?

주요 결과

  • StyleHEAT는 일회성 대화하는 얼굴 생성에서 최초로 1024×1024 해상도를 달성하였으며, 이는 이전 최고 성능 방법들이 512×512 이하로 제한된 것과 비교해 뚜렷한 향상이다.
  • 교정 네트워크는 눈과 입 주변의 눈에 띄는 아티팩트를 감소시켜, 일반적인 왜곡 접근 방식에서 흔히 발생하는 닫힌 눈과 이가 잘못 생성되는 문제를 해결한다.
  • 도메인 손실은 과도한 정규화를 방지하여 뿌연 이미지의 문제를 줄이고, 주름과 털 질감 같은 미세한 디테일을 유지함으로써 시각적 품질을 향상시킨다.
  • GAN 역전환을 통한 전반적 편집은 수염, 메이크업, 나이 등의 속성을 성공적으로 수정하면서도 운동 전달에 간섭하지 않으며, 시간적 일관성을 유지한다.
  • 3DMM 기반 파라미터를 통한 직관적 편집은 일관된 자세 및 표정 제어를 가능하게 하며, PIRenderer와 같은 3DMM 기반 기준 대비 훨씬 뛰어난 질감과 조명 정밀도를 제공한다.
  • 절단 실험 결과, 교정 네트워크와 도메인 손실이 고해상도 결과를 얻는 데 필수적임을 확인하였으며, 이들의 제거는 품질과 현실성에 심각한 열화를 초래한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.