Skip to main content
QUICK REVIEW

[論文レビュー] Emotion-Controllable Generalized Talking Face Generation

Sanjana Sinha, Sandika Biswas|arXiv (Cornell University)|May 2, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、1枚のニュートラルなアイデンティティ画像のみを用いて、未確認の顔に対しても一般化可能な1ショットで感情を制御可能な会話顔生成手法を提案する。音声と感情の入力を用いて幾何学的配慮のある顔の特徴点運動を生成するためのグラフ畳み込みネットワークを採用し、その後に光学フローを用いたテクスチャ生成ネットワークを適用することで、アイデンティティ、運動、感情を分離し、多様なアイデンティティと感情においてリアルで制御可能な顔のアニメーションを実現する。

ABSTRACT

Despite the significant progress in recent years, very few of the AI-based talking face generation methods attempt to render natural emotions. Moreover, the scope of the methods is majorly limited to the characteristics of the training dataset, hence they fail to generalize to arbitrary unseen faces. In this paper, we propose a one-shot facial geometry-aware emotional talking face generation method that can generalize to arbitrary faces. We propose a graph convolutional neural network that uses speech content feature, along with an independent emotion input to generate emotion and speech-induced motion on facial geometry-aware landmark representation. This representation is further used in our optical flow-guided texture generation network for producing the texture. We propose a two-branch texture generation network, with motion and texture branches designed to consider the motion and texture content independently. Compared to the previous emotion talking face methods, our method can adapt to arbitrary faces captured in-the-wild by fine-tuning with only a single image of the target identity in neutral emotion.

研究の動機と目的

  • 既存の音声駆動型会話顔生成手法における感情制御の欠如と一般化能力の不足に対処すること。
  • 1枚のニュートラルなアイデンティティ画像のみを用いて、任意の未確認の顔に対して感情を制御可能なアニメーションを可能にすること。
  • 顔のテクスチャ生成において、アイデンティティ、音声誘発運動、感情誘発変形を分離すること。
  • グラフベースの特徴点表現を用いて、アニメーション中の顔の幾何学的保存と感情の一貫性を向上させること。
  • アイデンティティ固有のファインチューニングや大規模データセットを必要とせず、高精細でアイデンティティ保持性の高い感情付き会話顔合成を達成すること。

提案手法

  • デローニー三角形分割された顔の特徴点グラフ上で、音声コンテンツと感情の入力を符号化するためのグラフ畳み込みネットワーク(GCN)を用い、幾何学的構造を保持したまま運動を生成する。
  • 学習可能なエッジ重みとスキップ接続を用いて、特徴量伝搬を改善し、空間的依存関係を維持する。
  • 予測された特徴点運動を用いて、アイデンティティに一貫性のある顔テクスチャを感情特有の変形とともに合成する、光学フローを用いたテクスチャ生成ネットワークを採用する。
  • 2本のブランチ構造を用いて運動とテクスチャコンテンツを分離し、感情特徴入力を用いて顔の表情を制御する。
  • 推論段階で1枚のニュートラルな顔画像を用いて、アイデンティティの1ショット学習を適用し、テクスチャネットワークをファインチューニングする。
  • 最終的な動画生成におけるリアリズムとアイデンティティ保持性を向上させるために、 adversarial loss と perceptual losses を用いる。

実験結果

リサーチクエスチョン

  • RQ11枚のニュートラルな顔画像のみを用いて、未確認の顔に対しても一般化可能な会話顔生成モデルは可能か?
  • RQ2感情アニメーション中に顔の構造を保持するため、顔の幾何学と感情誘発変形を効果的にモデリングする方法は何か?
  • RQ3運動生成プロセスにおいて、音声と感情を分離することで、顔の表情を独立して制御可能か?
  • RQ4光学フローを用いたテクスチャ生成アプローチは、感情を制御可能な会話顔合成におけるリアリズムとアイデンティティ保持性を向上させるか?
  • RQ5本手法は、多様なアイデンティティとデータセットにおいて、感情の正確性、リップシンク、視覚的リアリズムの観点でSOTA手法と比較してどのように優れているか?

主な発見

  • ユーザー研究において、本手法はアイデンティティ保持性と感情分類の正確性でSOTA性能を達成し、平均スコアはそれぞれ4.3/5および4.5/5を記録した。
  • 本手法は、RAVDESS や CREMA-D などの未学習のデータセットからの顔に対しても一般化可能であり、再訓練なしにリアルな感情表現を生成した。
  • アブレーションスタディの結果、感情特徴や感情誘発特徴点を除去すると感情正確性が著しく低下し、表現力豊かなアニメーションに不可欠であることが確認された。
  • 1ショット学習によりアイデンティティ保持性が向上し、CSIMスコアが上昇し、生成動画における顔の構造と肌色の保持が良好に維持された。
  • 光学フローを用いたテクスチャネットワークは、ベースライン手法に比べて視覚的リアリズムと一貫性に優れ、特に眉毛の動きや口元の形状変化といった微細な感情的キューを捉える点で優れた性能を示した。
  • 本手法は、リップシンクの正確性を維持しながら、感情の独立した制御を可能にした。これに対して、従来手法は一貫性のないまたは不自然な表情を生成する傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。