[論文レビュー] Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions
本論文は、連続的に制御可能な顔の表情を備えた高品質なトークィングフェイス動画をリアルタイムで生成するための、Dynamic Neural Textures (DNT) を提案する。表現を学習可能で表現に依存する神経テクスチャマップと3DMMベースの幾何モデルを用いて、表情と口唇運動を分離することで、正確でユーザーが制御可能な表現の強度と優れた口唇同期を実現し、定量的指標およびユーザースタディーの両面で最先端のベースラインを上回る性能を達成した。
Recently, talking-face video generation has received considerable attention. So far most methods generate results with neutral expressions or expressions that are implicitly determined by neural networks in an uncontrollable way. In this paper, we propose a method to generate talking-face videos with continuously controllable expressions in real-time. Our method is based on an important observation: In contrast to facial geometry of moderate resolution, most expression information lies in textures. Then we make use of neural textures to generate high-quality talking face videos and design a novel neural network that can generate neural textures for image frames (which we called dynamic neural textures) based on the input expression and continuous intensity expression coding (CIEC). Our method uses 3DMM as a 3D model to sample the dynamic neural texture. The 3DMM does not cover the teeth area, so we propose a teeth submodule to complete the details in teeth. Results and an ablation study show the effectiveness of our method in generating high-quality talking-face videos with continuously controllable expressions. We also set up four baseline methods by combining existing representative methods and compare them with our method. Experimental results including a user study show that our method has the best performance.
研究の動機と目的
- 既存のトークィングフェイス動画手法が中立的または制御不能な表情を生成するという限界を解決すること。
- 生成されたトークィングフェイス動画における顔の表情強度と種類について、リアルタイムで微細な制御を可能にすること。
- 時間的整合性と制御性の向上を図るため、口唇運動と顔の表情を分離すること。
- 専用サブモジュールを用いて、3DMMがカバーしない歯の領域の欠落した詳細を再構築し、口元の視覚的質を向上させること。
- 既存の最先端手法と比較して、表情制御、口唇同期、視覚的質において優れた性能を達成すること。
提案手法
- 本手法は、動的ニューラルテクスチャをサンプリングする幾何的基盤として3Dモーファブルモデル(3DMM)を用い、表現入力を条件とする高次元で学習可能な特徴マップである神経テクスチャマップを生成する。
- 独創的な分離ネットワークにより、表現表現と口唇運動、および頭部ポーズを分離し、表現強度と種類の独立した制御を可能にする。
- 連続的強度表現コード(CIEC)に条件付けられたニューラルネットワークを介して、動的ニューラルテクスチャ(DNT)を生成し、リアルタイムで連続的な表現制御を実現する。
- 歯の領域に特化したサブモジュールを導入し、3DMMがカバーしない部分の欠落した詳細を再構築することで、口元の領域におけるリアルリズムを向上させる。
- 神経レンダリングを用いて、動的ニューラルテクスチャと3D幾何から、写真のようにリアルなフレームを合成し、高い視覚的忠実度を確保する。
実験結果
リサーチクエスチョン
- RQ1高解像度のニューラルテクスチャに顔の表情情報を効果的に符号化することで、トークィングフェイス動画生成におけるより優れた表情制御が可能になるか?
- RQ2口唇同期と時間的整合性を保ちながら、リアルタイムで表現強度と種類を連続的に制御する方法は何か?
- RQ33D顔モデルにおいて、表現を口唇運動および頭部ポーズから効果的に分離するための分離ネットワークは、独立した制御を可能にするか?
- RQ4専用の歯サブモジュールは、生成されたトークィングフェイス動画の口元領域における視覚的質をどの程度向上させるか?
- RQ5表情制御、口唇同期、視覚的質の観点から、本手法は最先端の手法と比較してどのように差をつけるか?
主な発見
- 比較対象のすべての手法の中で最高のPSNR(27.41)とSSIM(0.892)を達成しており、優れた動画品質を示している。
- テストセットにおいてCSSスコアが6.71を記録し、正解の平均と一致しており、完全な口唇同期を示している。
- 除去実験では、動的ニューラルテクスチャや分離ネットワークを削除すると性能が著しく低下し、それらの必要性が確認された。
- 歯サブモジュールは、定性的な結果およびユーザースタディのフィードバックにより、口元領域の視覚的質の向上を確認した。
- ユーザースタディおよび定量的指標により、本手法がWav2Lip、StarGAN、ExprGAN、EVPを含むすべてのベースライン手法を上回ることが確認された、表情の制御性とリアリズムの両面で。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。