Skip to main content
QUICK REVIEW

[論文レビュー] 3D-TalkEmo: Learning to Synthesize 3D Emotional Talking Head

Qianyun Wang, Zhenfeng Fan|arXiv (Cornell University)|Apr 25, 2021
Face recognition and analysis参考文献 27被引用数 7
ひとこと要約

3D-TalkEmo は、制御可能な感情状態を備えた音声駆動型 3D 表情アニメーションのエンドツーエンドのディープラーニングフレームワークを提案する。本研究では、2D畳み込み処理に適した 3D 表情トポロジーの保持を目的として、多次元スケーリング(MDS)を用いた新しいジオメトリーマップを導入し、3Dメッシュ上での非ペアド感情転送を効果的に実現した。新しく作成された大規模な 3D 感情付きトークヘッドデータセットを用いた広範なユーザー調査と定量的評価により、リアルさ、コンテンツ保持性、感情表現力の面で最先端の性能を達成した。

ABSTRACT

Impressive progress has been made in audio-driven 3D facial animation recently, but synthesizing 3D talking-head with rich emotion is still unsolved. This is due to the lack of 3D generative models and available 3D emotional dataset with synchronized audios. To address this, we introduce 3D-TalkEmo, a deep neural network that generates 3D talking head animation with various emotions. We also create a large 3D dataset with synchronized audios and videos, rich corpus, as well as various emotion states of different persons with the sophisticated 3D face reconstruction methods. In the emotion generation network, we propose a novel 3D face representation structure - geometry map by classical multi-dimensional scaling analysis. It maps the coordinates of vertices on a 3D face to a canonical image plane, while preserving the vertex-to-vertex geodesic distance metric in a least-square sense. This maintains the adjacency relationship of each vertex and holds the effective convolutional structure for the 3D facial surface. Taking a neutral 3D mesh and a speech signal as inputs, the 3D-TalkEmo is able to generate vivid facial animations. Moreover, it provides access to change the emotion state of the animated speaker. We present extensive quantitative and qualitative evaluation of our method, in addition to user studies, demonstrating the generated talking-heads of significantly higher quality compared to previous state-of-the-art methods.

研究の動機と目的

  • 感情付きトークヘッドアニメーションのための 3D 生成モデルおよび同期音声・視覚・感情データセットの不足に取り組むこと。
  • 入力音声と感情ラベルが正確にペアになっていない状況下でも、3D 表情メッシュ上で非ペアド感情転送を可能にすること。
  • 有効な 2D畳み込み処理が行えるように、局所的な幾何的関係を保持する 3D フェイス表現を開発すること。
  • 中立的な 3D メッシュと音声入力を用いて、リアルで感情表現豊かな 3D トークヘッドを生成すること。
  • リアルさ、コンテンツ忠実度、感情の豊かさの観点から、定量的指標とユーザー調査を用いて手法の妥当性を検証すること。

提案手法

  • 本手法は、古典的多次元スケーリング(MDS)を用いたジオメトリーマップを導入し、頂点間の測地的距離を最小二乗法の観点で保持するように、3D 表情頂点座標を 2D キャンバスに射影する。
  • 3D-TalkEmo フレームワークは、中立的な 3D メッシュと音声シーケンスを入力とし、制御可能な感情状態を有する動的 3D 表情アニメーションシーケンスを生成する。
  • 感情転送は、ジオメトリーマップ表現上でスターバン(StarGAN)ベースのジェネレータを用いて実行され、異なる感情状態間での非ペアド学習を可能にする。
  • 中立的なトークモデルの学習時に局所的重み付け戦略を適用することで、再構成誤差と速度誤差を低減し、アニメーションのリアルさを向上させる。
  • 生成出力の過剰平滑化を防ぎ、識別器の感情クラス判別能力を高めるために、感情データ拡張を導入する。
  • 最先端の 3D フェイス再構築技術を活用して、多様な発話者、豊富な音声、複数の感情状態を備えた大規模かつ同期された 3D データセットを構築する。

実験結果

リサーチクエスチョン

  • RQ1音声入力のみで、制御可能な感情表現を持つリアルな 3D トークヘッドをディープラーニングモデルが生成できるか?
  • RQ23D 表情幾何を、局所的な隣接関係を保持し、効率的な 2D 畳み込み処理が可能な 2D 表現に効果的に射影する方法は何か?
  • RQ3トレーニングデータにおいて音声と感情が正確に一致しない状況下でも、3D 表情メッシュ上でどの程度非ペアド感情転送を達成できるか?
  • RQ4直接的な 3D 処理(例:PointNet)と比較して、提案されたジオメトリーマップは、感情転送の品質とノイズ耐性の面でどの程度優れているか?
  • RQ5データ拡張および損失重み付け戦略は、生成アニメーションのリアルさと感情の多様性にどのような影響を与えるか?

主な発見

  • 提案された局所的重み付け戦略により、再構成誤差(T-RE)が 1.573 から 0.116 に、速度誤差(T-VE)が 1.226 から 0.087 に低下し、アニメーションのリアルさが顕著に向上した。
  • 感情データ拡張戦略により、識別器の分類誤差(D-CE)が 5.36 から 2.09 に低下し、ジェネレータの多様な感情のモデリング能力が向上した(ただし、ジェネレータの再構成誤差はわずかに増加)。
  • 定性的な結果から、PointNet を用いた感情転送はノイズが多く破損した出力を生成した一方、3D-TalkEmo は、落ち着いた状態から笑顔への感情転送を高い忠実度で成功させた。
  • 23名の参加者と 345 回の回答を含むユーザー調査により、リアルさ、コンテンツ保持性、感情の豊かさのすべての面で 3D-TalkEmo がベースラインを上回っていることが確認され、統計的に有意な好まれ方を示した。
  • ジオメトリーマップは頂点の隣接関係と局所的構造を保持しており、2D CNN が 3D 表面上の顔の動きと感情の遷移を効果的にモデル化できるようにした。
  • 定量的指標と人間評価の両面で検証された結果、本手法は感情表現豊かな 3D トークヘッド生成において最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。