Skip to main content
QUICK REVIEW

[論文レビュー] Speech Driven Talking Face Generation from a Single Image and an Emotion Condition

Şefik Emre Eskimez, You Zhang|arXiv (Cornell University)|Aug 8, 2020
Face recognition and analysis参考文献 64被引用数 9
ひとこと要約

本論文は、1枚の参照画像とカテゴリカルな感情ラベルを条件として、視覚的感情表現を正確に制御できる、エンドツーエンドのニューラルネットワークを提案する。このシステムは、客観的指標(画像品質、音声視覚同期、感情表現)および主観的評価において、最先端のベースラインを上回り、動画の現実性と感情の現実性に優れている。パイロットスタディーでは、人間が感情を認識する際に視覚的側面を音声的側面よりも重視していることが確認された。

ABSTRACT

Visual emotion expression plays an important role in audiovisual speech communication. In this work, we propose a novel approach to rendering visual emotion expression in speech-driven talking face generation. Specifically, we design an end-to-end talking face generation system that takes a speech utterance, a single face image, and a categorical emotion label as input to render a talking face video synchronized with the speech and expressing the conditioned emotion. Objective evaluation on image quality, audiovisual synchronization, and visual emotion expression shows that the proposed system outperforms a state-of-the-art baseline system. Subjective evaluation of visual emotion expression and video realness also demonstrates the superiority of the proposed system. Furthermore, we conduct a human emotion recognition pilot study using generated videos with mismatched emotions among the audio and visual modalities. Results show that humans respond to the visual modality more significantly than the audio modality on this task.

研究の動機と目的

  • 音声とカテゴリカルな感情ラベルを条件として、リアルな視覚的感情表現を再現できる会話顔生成システムの開発。
  • 生成された会話顔における感情表現を、音声のオーディオから独立して柔軟に制御可能にする。
  • 客観的および主観的評価を通じて、生成動画の現実性と感情表現の豊かさを評価する。
  • 音声と視覚の感情的内容が不一致である音声視覚的会話における人間の感情認識を調査する。
  • 行動心理学実験やエンターテインメント、教育、補助技術分野におけるパーソナライズドアプリケーションのためのツールを提供する。

提案手法

  • 本システムは、音声スペクトログ램、参照顔画像、およびカテゴリカルな感情ラベルを入力として受ける条件付き生成対抗ネットワーク(cGAN)アーキテクチャを採用する。
  • 入力された感情ラベルに一致するリアルな視覚的感情表現を生成するように、生成器を学習させるために、新しい感情判別損失を導入する。
  • 時間的整合性および口唇運動・頭部運動の現実性を向上させるために、マルチリセプティブフィールド(MRM)損失を採用する。
  • 生成器は、対抗損失、知覚的損失、およびアイデンティティ保持損失の組み合わせで訓練され、顔の同一性と視覚的品質を維持する。
  • 感情の条件付けは、カテゴリカルな感情ラベルを生成器の潜在空間に組み込む埋め込み層によって実装される。
  • 訓練パイプラインには、生成動画シーケンスの時間的整合性を強制するためのシーケンス識別器が含まれる。

実験結果

リサーチクエスチョン

  • RQ1カテゴリカルな感情ラベルを条件として、音声のオーディオとは独立して、ニューラル会話顔生成システムが視覚的感情表現を効果的に再現できるか。
  • RQ2提案手法は、画像品質、音声視覚同期、感情表現の観点で、最先端のベースラインと比較してどのように異なるか。
  • RQ3音声と視覚の感情的内容が不一致である音声視覚的会話において、人間が感情を認識する際に視覚的側面と音声的側面のどちらに依存しているか。
  • RQ4人間評価者による評価において、生成された会話顔動画は、実際の動画と比べてどれほど現実的と感じられるか。
  • RQ5本システムは、感情表現と現実性の観点で、人間の視認では区別がつかないほどリアルな会話顔動画を生成できるか。

主な発見

  • ウィルコクソン符号順位検定において、本手法はベースラインよりも動画の現実性で統計的に有意な改善を示した(p値 = 0.048)。
  • 主観的評価では、35.2%の被験者が生成動画の視覚的感情を正しく特定したが、音声的感情は25.1%にとどまり、感情認識における視覚的優位性が示された。
  • 主な感情ラベルと補助的ラベルの両方を考慮した場合、視覚的感情に一致する回答は44.9%であったのに対し、音声的感情は33.8%にとどまり、視覚モalityの優位性がさらに確認された。
  • 実際の動画は平均して4(多少現実的)に近い現実性評価を得ており、実際の動画ですら生成動画ほど現実的に感じられない可能性がある(解像度が低いことが要因と推測される)。
  • ベースラインモデルは、画像品質と口唇同期の問題について多くのフィードバックを受けたが、本手法は頭部運動と口唇同期において実動画と同等の性能を示し、MRM損失の有効性が裏付けられた。
  • 両方の客観的指標と人間評価による検証を通じて、本システムは高い知覚的品質と正確な感情表現を有する動画を効果的に生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。