Skip to main content
QUICK REVIEW

[論文レビュー] Visual Speech-Aware Perceptual 3D Facial Expression Reconstruction from Videos

Panagiotis P. Filntisis, George Retsinas|arXiv (Cornell University)|Jul 22, 2022
Facial Nerve Paralysis Treatment and Research被引用数 7
ひとこと要約

本論文は、音声やテキストの転写が不要な動画からの視覚的会話に配慮した3次元顔面表情再構築手法を提案する。『lipread』損失を用いることで、実際の会話する顔の動きとの間の知覚的差を最小化し、口元の動きの自然さを向上させる。事前学習済みの唇読みモデルを活用することで、再構築された顔と実際の会話する顔の間の知覚的差を最小化し、幾何学的およびランドマークベースの損失に比べて口元の動きの忠実度を著しく向上させ、3次元会話する顔の再構築における知覚的自然さを顕著に向上させる。

ABSTRACT

The recent state of the art on monocular 3D face reconstruction from image data has made some impressive advancements, thanks to the advent of Deep Learning. However, it has mostly focused on input coming from a single RGB image, overlooking the following important factors: a) Nowadays, the vast majority of facial image data of interest do not originate from single images but rather from videos, which contain rich dynamic information. b) Furthermore, these videos typically capture individuals in some form of verbal communication (public talks, teleconferences, audiovisual human-computer interactions, interviews, monologues/dialogues in movies, etc). When existing 3D face reconstruction methods are applied in such videos, the artifacts in the reconstruction of the shape and motion of the mouth area are often severe, since they do not match well with the speech audio. To overcome the aforementioned limitations, we present the first method for visual speech-aware perceptual reconstruction of 3D mouth expressions. We do this by proposing a "lipread" loss, which guides the fitting process so that the elicited perception from the 3D reconstructed talking head resembles that of the original video footage. We demonstrate that, interestingly, the lipread loss is better suited for 3D reconstruction of mouth movements compared to traditional landmark losses, and even direct 3D supervision. Furthermore, the devised method does not rely on any text transcriptions or corresponding audio, rendering it ideal for training in unlabeled datasets. We verify the efficiency of our method through exhaustive objective evaluations on three large-scale datasets, as well as subjective evaluation with two web-based user studies.

研究の動機と目的

  • 動画からの3次元顔面再構築における知覚的自然さの欠如、特に会話中の口元の動きの改善に寄与すること。
  • 従来の2次元ランドマークおよび3次元の監視手法の限界を克服し、会話関連の発音機構の詳細を捉えること。
  • 人間の会話認識に配慮した再構築された3次元会話する顔の知覚的一致性を向上させること。
  • テキストの転写や音声に依存しないように、学習に視覚データのみを用いること。
  • 知覚的損失が幾何学的および直接的な3次元監視に比べて、会話関連の顔面動的挙動をモデル化する上で優れていることを検証すること。

提案手法

  • 本手法は、事前学習済みの唇読みモデルを用いて、レンダリングされた3次元会話する顔と元の動画映像との間の知覚的距離を最小化する『lipread』損失を導入する。
  • lipread損失は最適化プロセス中に適用され、再構築された口元の動きが元の動画と同様の会話認識を引き起こすように3次元メッシュのフィッティングをガイドする。
  • 知覚的自然さと幾何学的正確性の両立を図るため、lipread損失とランドマークベースの損失を組み合わせる。過剰最適化によるアーチファクトを回避する。
  • 最先端の3次元顔面再構築パイプライン(例:DECA や類似手法)を活用し、3次元の真値や音声が不要な状態で知覚的損失を追加する。
  • ラベルなしの動画データ上でエンドツーエンドに学習されるため、大規模かつ実世界の応用に適している。
  • 訓練の安定化と形状の歪みの防止のため、相対的ランドマーク損失を用いる。特に、lipread損失のみでアーチファクトが生じる場合に有効である。

実験結果

リサーチクエスチョン

  • RQ1唇読みに基づく知覚的損失は、動画からの3次元会話する顔の口元の動きの自然さを向上させることができるか?
  • RQ2lipread損失は、従来の2次元ランドマークおよび直接的な3次元監視に比べ、会話関連の顔面動的挙動の再構築において優れているか?
  • RQ3テキストの転写や音声が不要な3次元顔面再構築手法は、知覚的品質を高く維持できるか?
  • RQ4lipread損失とランドマーク損失の組み合わせは、知覚的自然さと幾何学的忠実度のトレードオフにどのように影響するか?
  • RQ5本手法は、会話動画で学習したにもかかわらず、非会話的口元の動きへも一般化できるか?

主な発見

  • 客観的および主観的評価の両方で、lipread損失は従来の2次元ランドマークおよび直接的な3次元監視に比べ、会話関連の口元の動きの再構築において顕著に優れていることが確認された。
  • ユーザースタディにおいて、本手法は優れた知覚的品質を達成し、参加者らがベースライン手法よりも再構築された会話する顔を好む傾向が一貫して観察された。
  • テキストの転写や音声にアクセスできない状況下でも、本手法は会話認識を保持する3次元再構築を生成し、視覚のみの知覚的監視の有効性を示した。
  • lipread損失は、特に双唇子音や円唇母音のような、知覚的自然さに重要な要素を的確に再現する口元の動きをもたらした。
  • 非会話的顔面運動に対しても本手法は良好な一般化性能を示しており、学習された表現が会話に限定されず、一般的な表現的挙動を捉えていることを示唆している。
  • 高い知覚的性能を達成しているにもかかわらず、レンダリング済み画像と実画像とのドメインギャップのため、CER や WER といった客観的指標は依然として高いままだった。特に、歯や舌の詳細が欠落していることが主な要因であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。