[論文レビュー] DINet: Deformation Inpainting Network for Realistic Face Visually Dubbing on High Resolution Video
本稿では、高解像度動画における高精細で写真のようにリアルな顔のビジュアルダブイングを実現するための変形インpaintingネットワーク、DINetを提案する。音声駆動の口元の形状と頭部の姿勢に合わせて参照画像の顔特徴マップを空間的に変形し、学習されたデコーダーを用いて口元領域をインpaintingすることで、直接生成手法に比べて高周波数のテクスチャディテールをより良く保持する。HDTFなどの高解像度ベンチマークにおいて、定量的・定性的な両評価で最先端の結果を達成した。
For few-shot learning, it is still a critical challenge to realize photo-realistic face visually dubbing on high-resolution videos. Previous works fail to generate high-fidelity dubbing results. To address the above problem, this paper proposes a Deformation Inpainting Network (DINet) for high-resolution face visually dubbing. Different from previous works relying on multiple up-sample layers to directly generate pixels from latent embeddings, DINet performs spatial deformation on feature maps of reference images to better preserve high-frequency textural details. Specifically, DINet consists of one deformation part and one inpainting part. In the first part, five reference facial images adaptively perform spatial deformation to create deformed feature maps encoding mouth shapes at each frame, in order to align with the input driving audio and also the head poses of the input source images. In the second part, to produce face visually dubbing, a feature decoder is responsible for adaptively incorporating mouth movements from the deformed feature maps and other attributes (i.e., head pose and upper facial expression) from the source feature maps together. Finally, DINet achieves face visually dubbing with rich textural details. We conduct qualitative and quantitative comparisons to validate our DINet on high-resolution videos. The experimental results show that our method outperforms state-of-the-art works.
研究の動機と目的
- 高解像度動画における写真のようにリアルな顔のビジュアルダブイングを、少数のサンプル学習で実現すること。
- 直接ピixe リ生成手法では口元領域の高周波数テクスチャディテールを保持できないという限界を克服すること。
- エンドツーエンドの生成ではなく、参照画像特徴の空間的変形を活用することで、リップシンクロニゼーションと顔のリアルさを向上させること。
- 音声駆動の口元動きと正確に一致させつつ、アイデンティティ、頭部の姿勢、上部顔の表情の一貫性を維持すること。
- 既存の最先端手法と比較して、高解像度動画データセットで優れた性能を発揮すること。
提案手法
- DINetは主に2つのモジュールから構成される:変形部とインpainting部。
- 変形部は、ドライブ音声とソース顔の頭部姿勢に基づいて、5枚の参照顔画像の特徴マップを変形するためのアダプティブ空間変換(AdaAT)を用いる。
- AdaATは正則化を伴う領域レベルの変形を実行し、アテンションや密なフローのようなピクセルレベル手法よりも、構造的・テクスチャ的ディテールの保持をより効果的に行う。
- インpainting部は、変形された口元特徴とソース顔の特徴(頭部姿勢および上部顔の表情を含む)を畳み込みデコーダーで融合し、口元領域を再構築する。
- ネットワークは、リアルさと整合性を確保するため、知覚的損失、 adversarial 損失、および音声視覚同期損失を用いて訓練される。
- アブレーションスタディにより、直接生成法に比べて変形の有効性が検証され、アテンションや密なフローに比べてAdaATが特徴変形において優れていることが示された。
実験結果
リサーチクエスチョン
- RQ1参照画像特徴の空間的変形は、高解像度顔のビジュアルダブイングにおける高周波数テクスチャの保持を改善できるか?
- RQ2視覚的忠実度とリップシンクロニゼーションの観点から、変形ベースの特徴操作は直接ピクセル生成法と比べてどのように異なるか?
- RQ3アテンションや密なフローなどの異なる変形メカニズム(例:AdaAT 対 アテンション 対 密なフロー)は、テクスチャ保持とアーティファクト発生にどのような影響を与えるか?
- RQ4少数のサンプルで学習する手法は、音声からリアルな口元動きを生成する際、アイデンティティと頭部姿勢の一貫性をどの程度維持できるか?
- RQ5提案された変形・インpaintingフレームワークは、既存の最先端手法を高解像度動画ベンチマークで上回るか?
主な発見
- HDTFデータセットにおいて、DINetは最高のSSIM(0.9425)、PSNR(30.0082)、最小のLPIPS(0.0289)を達成し、すべてのアブレーションバリアントおよびSOTA手法を上回った。
- アブレーションスタディにより、変形部を削除するとSSIMは0.9147、PSNRは26.1665に低下し、ディテール保持に果たす変形部の重要性が示された。
- インpaintingモジュールを省略した場合、目立つアーティファクトと品質低下(SSIM:0.8691、PSNR:26.0071)が生じ、特徴の統合の必要性が確認された。
- アテンションや密なフローを用いた変形では、LPIPSがそれぞれ0.0433および0.0656に上昇し、目や視線などの顔の構造に顕著なアーティファクトが発生した。
- ユーザースタディでは、DINetが最高のリアリズムスコア(5段階中3.4)を記録し、Wav2Lip(2.4)、ATVG(2.9)、MakeItTalk(3.1)、PC-AVS(3.3)を上回った。
- 本手法は、しばしば直接生成法でぼやけるような繊細なテクスチャ(例:ひげ、鼻唇溝)を効果的に保持できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。