Skip to main content
QUICK REVIEW

[論文レビュー] Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation

Xian Liu, Yinghao Xu|arXiv (Cornell University)|Jan 19, 2022
Advanced Vision and Imaging被引用数 7
ひとこと要約

本論文では、高精細で音声駆動の動画ポートレート生成を実現する統合的暗黙的ニューラルレイトランスフィールドフレームワーク、SSP-NeRFを提案する。セマンティックに注意を払う動的レイサンプリングモジュールとトールソー変形モジュールを導入することで、明示的な3D構造に依存せずに、より高い口唇同期の正確性と現実的な頭部・胴体の動きの整合性を達成した。定量的指標および人間評価において、先行手法を上回る性能を発揮した。

ABSTRACT

Animating high-fidelity video portrait with speech audio is crucial for virtual reality and digital entertainment. While most previous studies rely on accurate explicit structural information, recent works explore the implicit scene representation of Neural Radiance Fields (NeRF) for realistic generation. In order to capture the inconsistent motions as well as the semantic difference between human head and torso, some work models them via two individual sets of NeRF, leading to unnatural results. In this work, we propose Semantic-aware Speaking Portrait NeRF (SSP-NeRF), which creates delicate audio-driven portraits using one unified set of NeRF. The proposed model can handle the detailed local facial semantics and the global head-torso relationship through two semantic-aware modules. Specifically, we first propose a Semantic-Aware Dynamic Ray Sampling module with an additional parsing branch that facilitates audio-driven volume rendering. Moreover, to enable portrait rendering in one unified neural radiance field, a Torso Deformation module is designed to stabilize the large-scale non-rigid torso motions. Extensive evaluations demonstrate that our proposed approach renders more realistic video portraits compared to previous methods. Project page: https://alvinliu0.github.io/projects/SSP-NeRF

研究の動機と目的

  • 明示的な3D構造の監視に依存せずに、音声駆動の高精細な動画ポートレートを生成する課題に取り組むこと。
  • 先行する2-NeRFアプローチにおける頭部と胴体のモデリングにおいて一般的に見られる不安定さや不自然な頭部・胴体分離の問題を解消すること。
  • レイサンプリングにセマンティックな注意を払うことで、顔の細部のレンダリングと口唇同期の正確性を向上させること。
  • ポーズに依存する変位を学習する変形モジュールを用いて、グローバルな非剛体的胴体運動を安定化させること。
  • 全体のポートレートにわたる幾何学的整合性と動きの整合性を維持する、統合的でエンドツーエンドのニューラルレンダリングパイプラインを実現すること。

提案手法

  • セマンティックに注意を払う動的レイサンプリングモジュールには、顔のセマンティック領域に基づいてレイの動的サンプリングを誘導する2次元ポートレート解析ブランチが含まれており、周波数が高く動きの激しい領域(例:口唇、歯)を優先的に処理する。
  • 表情パラメータを含まない3DMM頂点に潜在コードをアンカーリングすることで、顔の細部に対するセマンティック監視を強化する。
  • トールソー変形モジュールは、頭部ポーズと時間の流れに基づいて3次元座標の変位を予測し、頭部から不自然に分離しないように、グローバルな胴体運動を暗黙的にモデル化する。
  • 変形モジュールは音声ではなく、キャノニカルな頭部ポーズと時間に条件付けられており、音声駆動の顔のダイナミクスと胴体の動きのモデリングを分離する。
  • 全フレームワークは1つのNeRFを用いて全ポートレートをレンダリングし、音声入力がセマンティックおよび変形コンポonentsの両方を調整する。
  • モデルは、知覚的損失、再構成損失、音声・視覚同期損失を組み合わせたマルチコンポonent損失を用いて訓練される。

実験結果

リサーチクエスチョン

  • RQ1統合的NeRFフレームワークは、音声駆動のポートレート生成において、局所的な顔のダイナミクスとグローバルな頭部・胴体の動きを効果的にモデル化できるか?
  • RQ2均一なサンプリングと比較して、セマンティックに注意を払うレイサンプリングは、どのような点で細部の忠実度と口唇同期の正確性を向上させるか?
  • RQ3ポーズに依存する変位を学習する変形モジュールは、明示的な3D監視がなくても、胴体の動きを安定化させられるか?
  • RQ4顔のダイナミクスと変形のモデリングにおける音声モodulationの分離は、より整合的で現実的な結果をもたらすか?
  • RQ5本手法は、最先端の手法と比較して、画像品質、口唇同期、動きの整合性の観点でどのように優れているか?

主な発見

  • テストセットにおいて、SSP-NeRFはPSNRが32.785、SSIMが0.876、LMDが4.495、Syncが4.993を達成し、すべての指標で先行手法を上回った。
  • アブレーションスタディの結果、セマンティックブランチを削除するとPSNRが3.306低下し、Syncが0.431低下することが確認され、細部と同期性の向上にその重要性が示された。
  • 動的レイサンプリングコンポーネントは、均一なサンプリングと比較してPSNRを0.271向上させ、Syncを0.104向上させた。
  • トールソー変形モジュールを導入することで、変形なしのベースラインと比較してPSNR損失が4.711低下し、Sync損失が0.872低下した。これは、胴体運動の安定化に有効であることを証明した。
  • 可視化結果から、変形モジュールが主に胴体領域に影響を与え、頭部ポーズが大きくなるに従い、より大きな変位を学習していることが確認され、グローバルな動きの適切な学習が行われていることが示された。
  • 人間評価の結果、SSP-NeRFは、特に口唇同期と自然な頭部・胴体の連携において、既存手法よりも現実的で整合性の取れた動画ポートレートを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。