Skip to main content
QUICK REVIEW

[論文レビュー] Learning Audio-Driven Viseme Dynamics for 3D Face Animation

Linchao Bao, Haoxian Zhang|arXiv (Cornell University)|Jan 15, 2023
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、発話動画から発音子ガイド付きトラッキングと深層音声-発音子カーブマッピングネットワークを用いて発音子ダイナミクスを学習する、音声駆動型3次元顔面アニメーションシステムを提案する。この手法は、多様なキャラクターに適用可能なリアルなアニメーターフレンドリーな口唇同期アニメーションを生成し、音声歪みに強く、多言語入力をサポートする。

ABSTRACT

We present a novel audio-driven facial animation approach that can generate realistic lip-synchronized 3D facial animations from the input audio. Our approach learns viseme dynamics from speech videos, produces animator-friendly viseme curves, and supports multilingual speech inputs. The core of our approach is a novel parametric viseme fitting algorithm that utilizes phoneme priors to extract viseme parameters from speech videos. With the guidance of phonemes, the extracted viseme curves can better correlate with phonemes, thus more controllable and friendly to animators. To support multilingual speech inputs and generalizability to unseen voices, we take advantage of deep audio feature models pretrained on multiple languages to learn the mapping from audio to viseme curves. Our audio-to-curves mapping achieves state-of-the-art performance even when the input audio suffers from distortions of volume, pitch, speed, or noise. Lastly, a viseme scanning approach for acquiring high-fidelity viseme assets is presented for efficient speech animation production. We show that the predicted viseme curves can be applied to different viseme-rigged characters to yield various personalized animations with realistic and natural facial motions. Our approach is artist-friendly and can be easily integrated into typical animation production workflows including blendshape or bone based animation.

研究の動機と目的

  • リソース制限や非プロフェッショナルな制作環境においても、音声のみからリアルな口唇同期が可能な3次元顔面アニメーションを生成する課題に取り組む。
  • 直接メッシュ頂点ではなく発音子重みカーブとしてアニメーションをモデル化することで、制御性とアーティストフレンドリー性を向上させる。
  • 頑健な音声-発音子カーブマッピングモデルを用いることで、未観測の声質や多言語発話入力への一般化を可能にする。
  • 実際の俳優から高精細な発音子アセットを取得するための発音子スキャンパイプラインを導入し、生産効率の向上を図る。

提案手法

  • 発音子事前知識を用いて発音子と高い相関を持つ発音子重みカーブを抽出する、新規の発音子ガイド付き顔面トラッキングアルゴリズムを提案する。
  • 多言語事前学習モデルからの生の音声特徴を発音子重みカーブにマップする深層ニューラルネットワークを訓練し、音声からアニメーションカーブを予測可能にする。
  • 時系列モデリングのためのバックボーンとして、残差接続付きの時空間畳み込みネットワーク(TCN)を採用する。
  • アブレーションスタディおよび性能比較のため、トランスフォーマーに基づくデコーダーを統合し、優れた一般化性能と頑健性を示す。
  • 変形伝達とSSDRベースのボーンポーズ変換を用いて発音子カーブのリターゲティングを実現し、ブレンドシェイプおよびボーンベースのアニメーションパイプラインの両方をサポートする。
  • 実際の俳優から高精細な発音子アセットを取得するための発音子スキャン手順を開発し、新規キャラクターのパーソナライズアニメーションを可能にする。

実験結果

リサーチクエスチョン

  • RQ1動画からの発音子ガイド付き発音子カーブ抽出は、発音子重みと発音子の相関を向上させ、アニメーターのコントロール性を高めることができるか?
  • RQ2学習された音声-発音子カーブマッピングモデルは、未観測の話者や多言語発話入力にどの程度一般化できるか?
  • RQ3本手法は、既存の音声駆動型顔面アニメーション技術に比べ、リアリズムと自然さの面でどの程度優れているか?
  • RQ4同じ予測発音子カーブを、異なる顔面リグやスタイルを持つ複数の3次元キャラクターに効果的に再利用できるか?
  • RQ5ボリュームの変化、ピッチシフト、背景ノイズなどの音声歪みに対して、このシステムはどの程度頑健か?

主な発見

  • 提案された発音子ガイド付き発音子フィッティングアルゴリズムは、発音子重みと発音子の相関を顕著に向上させ、より予測可能でアーティストフレンドリーなアニメーションカーブを実現した。
  • 音声-カーブマッピングモデルは、ピッチ、ボリューム、速度の変化などの音声歪みが加わっても、口唇同期の正確性と自然さにおいて最先端のパフォーマンスを達成した。
  • 同じ予測発音子カーブを、異なる発音子リグ付きの3次元キャラクターに複数回適用しても、リアルでパーソナライズされたアニメーションを生成することができた。
  • 多言語事前学習音声特徴の使用により、システムは多言語発話入力をサポートし、未観測の言語や声質への一般化を可能にした。
  • 発音子スキャンパイプラインにより、高精細な発音子アセットの効率的取得が可能になり、デジタルヒューマンやスタイライズドキャラクターの生産を簡素化した。
  • 本手法は、ブレンドシェイプおよびボーンベースのアニメーションパイプラインの両方と互換性があり、Unity や Unreal Engine などのリアルタイムエンジンにおける既存のアニメーションワークフローへのシームレスな統合を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。