Skip to main content
QUICK REVIEW

[論文レビュー] StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGAN

Fei Yin, Yong Zhang|arXiv (Cornell University)|Mar 8, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、事前学習済みのStyleGANを用いて1024×1024解像度の1ショット編集可能な会話顔動画生成を実現する統合フレームワーク、StyleHEATを提案する。本手法は学習済み潜在空間の特性を活用し、動画/音声駆動用のモーション生成器、歪み補正のためのキャリブレーションネットワーク、特徴の精錬のためのドメイン損失を備え、高分解能の学習データを必要とせず、分離制御と柔軟な編集を可能にする。

ABSTRACT

One-shot talking face generation aims at synthesizing a high-quality talking face video from an arbitrary portrait image, driven by a video or an audio segment. One challenging quality factor is the resolution of the output video: higher resolution conveys more details. In this work, we investigate the latent feature space of a pre-trained StyleGAN and discover some excellent spatial transformation properties. Upon the observation, we explore the possibility of using a pre-trained StyleGAN to break through the resolution limit of training datasets. We propose a novel unified framework based on a pre-trained StyleGAN that enables a set of powerful functionalities, i.e., high-resolution video generation, disentangled control by driving video or audio, and flexible face editing. Our framework elevates the resolution of the synthesized talking face to 1024*1024 for the first time, even though the training dataset has a lower resolution. We design a video-based motion generation module and an audio-based one, which can be plugged into the framework either individually or jointly to drive the video generation. The predicted motion is used to transform the latent features of StyleGAN for visual animation. To compensate for the transformation distortion, we propose a calibration network as well as a domain loss to refine the features. Moreover, our framework allows two types of facial editing, i.e., global editing via GAN inversion and intuitive editing based on 3D morphable models. Comprehensive experiments show superior video quality, flexible controllability, and editability over state-of-the-art methods.

研究の動機と目的

  • 1024×1024解像度の会話顔動画を1枚のポートレート画像から生成する挑戦に、高解像度の学習データが限られているという制約を克服する。
  • 高解像度の学習からではなく、事前学習済みのStyleGANの潜在空間を利用することで、1ショット会話顔生成における解像度のボトル neck を克服する。
  • 動画または音声駆動信号によるモーションの分離制御を可能にし、柔軟で制御可能なアニメーションを実現する。
  • GANインバージョンによる顔の属性全体編集と、動画生成中に3次元可塑的モデル(3DMM)を用いた直感的な編集を両方サポートする。
  • 潜在空間変換における特徴の歪みアーティファクトを低減するため、専用のキャリブレーションネットワークとドメイン損失を導入する。

提案手法

  • 高解像度の学習データを必要とせず、事前学習済みのStyleGANの潜在特徴空間を活用し、潜在コードに空間的変換を適用することで1024×1024解像度の顔を生成する。
  • ドライブ動画のフレームから3DMMパラメータを予測し、それらを潜在空間変換にマップする動画ベースのモーション生成モジュールを設計する。
  • 音声特徴を3DMMパラメータにマッピングする音声ベースのモーション生成モジュールを実装し、口ずさんみと表情制御を実現する。
  • 歪みアーティファクト(特に目や口の周辺)を補正するため、歪んだ潜在特徴を精錬するキャリブレーションネットワークを導入する。
  • 補正された特徴が元のStyleGANの分布に収束するようドメイン損失を適用し、アイデンティティとテクスチャの忠実度を維持する。
  • 2種類の編集パラダイムをサポートする:GANインバージョンによるグローバル属性編集(例:ヒゲ、化粧、年齢)と、3DMMベースの操作による直感的なポーズ/表情制御。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのStyleGANの潜在空間を活用することで、高解像度の学習データを必要とせずに1024×1024解像度の会話顔動画を生成できるか?
  • RQ2動画または音声からのモーションをどのように分離し、潜在空間に適用することで一貫性のある顔のアニメーションを実現できるか?
  • RQ3高解像度生成における潜在空間変換における歪み誘発アーティファクトを効果的に是正するメカニズムは何か?
  • RQ4GANインバージョンによるグローバル編集で顔の属性(例:ヒゲ、化粧、年齢)を変更しても、モーション品質とアイデンティティを保持できるか?
  • RQ53DMMパラメータを用いた直感的編集を、高解像度かつ1ショットの会話顔生成フレームワークに効果的に統合できるか?

主な発見

  • StyleHEATは、1ショット会話顔生成において1024×1024解像度を達成した最初の手法であり、従来の最先端手法が512×512やそれ以下の解像度に制限されていたのに対し顕著に上回る。
  • キャリブレーションネットワークにより、目や口の周辺の目立つアーティファクトが低減され、閉じた目や歯の正確な再現が可能となり、ベースラインの歪み処理手法ではよく見られる歪みが解消された。
  • ドメイン損失により視覚的品質が向上し、過剰正則化を防ぎ、ぼやけを低減するとともに、しわや髪の毛のテクスチャといった細部を保持する。
  • GANインバージョンによるグローバル編集は、ヒゲや化粧、年齢といった属性を効果的に変更可能であり、モーション伝達に干渉せず、時間的整合性を維持した。
  • 3DMMパラメータを用いた直感的編集により、一貫性のあるポーズ・表情制御が可能となり、PIRendererのような3DMMベースのベースラインと比較して、テクスチャとライティングの忠実度が優れている。
  • アブレーションスタディにより、キャリブレーションネットワークとドメイン損失の両方が高精細な結果に不可欠であることが確認され、それらを除去すると品質と現実性が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。