[論文レビュー] An Implementation of Multimodal Fusion System for Intelligent Digital Human Generation
本稿では、大規模言語モデル、ボイスクラーニング、画像から動画への変換を用いて、テキスト、音声、画像入力を統合するマルチモーダル融合システムを提案する。このシステムにより、人物に依存しないおよび人物に依存するデジタル人間駆動、年齢変換、スタイル移行、スーパーレゾリューションが可能となり、視覚的品質とユーザーエクスペリエンスの面で最先端の性能を達成する高品質でインタラクティブなデジタル人間動画の生成が実現される。
With the rapid development of artificial intelligence (AI), digital humans have attracted more and more attention and are expected to achieve a wide range of applications in several industries. Then, most of the existing digital humans still rely on manual modeling by designers, which is a cumbersome process and has a long development cycle. Therefore, facing the rise of digital humans, there is an urgent need for a digital human generation system combined with AI to improve development efficiency. In this paper, an implementation scheme of an intelligent digital human generation system with multimodal fusion is proposed. Specifically, text, speech and image are taken as inputs, and interactive speech is synthesized using large language model (LLM), voiceprint extraction, and text-to-speech conversion techniques. Then the input image is age-transformed and a suitable image is selected as the driving image. Then, the modification and generation of digital human video content is realized by digital human driving, novel view synthesis, and intelligent dressing techniques. Finally, we enhance the user experience through style transfer, super-resolution, and quality evaluation. Experimental results show that the system can effectively realize digital human generation. The related code is released at https://github.com/zyj-2000/CUMT_2D_PhotoSpeaker.
研究の動機と目的
- 従来のデジタル人間作成における高コストと長期的な開発サイクルを解消するため、AIを用いたプロセスの自動化を目的とする。
- テキスト、音声、画像のマルチモーダル入力により、インタラクティブでパーソナライズされたデジタル人間生成を実現することを目的とする。
- 年齢変換、スタイル移行、スーパーレゾリューション、インテリジェントな服装変更を通じて、ユーザーエクスペリエンスの向上を図ることを目的とする。
- 柔軟な応用が可能な、人物に依存しないおよび人物に依存するデジタル人間駆動を両方サポートするシステムの開発を目的とする。
- 包括的な画像および動画品質評価指標を用いて、システムの有効性を検証することを目的とする。
提案手法
- 事前処理では、大規模言語モデル(LLM)を用いたテキスト理解、音声プロファイル抽出、および音声生成のためのテキスト音声変換(TTS)合成が行われる。
- 入力された画像は、SAMモデルを用いて年齢変換され、パーソナライズされたデジタル人間用の年齢調整済み顔画像が生成される。
- 人物に依存しない(SadTalker)および人物に依存する(LiveSpeechPortraits)ドライブ手法を用いて、薄板スプライン運動モデルを介したモーションリターゲティングを伴い、デジタル人間動画の生成が達成される。
- インテリジェントな服装変更は、VITON-HDモデルを用いて生成された動画フレーム内の衣装を変更することで実装される。
- 後処理には、DCT-Netを用いたスタイル移行、BasicVSR++を用いたスーパーレゾリューション、およびVSFA、FastVQA、CGIQA、CPBDを用いた品質評価が含まれる。
- すべてのモジュールが統合された一貫したパイプラインにより、マルチモーダル入力からエンドツーエンドのデジタル人間動画生成が実現される。
![Figure 1: Classification of digital human. The selected digital humans are from the DDH-QA [ 2 ] and SJTU-H3D [ 3 ] databases.](https://ar5iv.labs.arxiv.org/html/2310.20251/assets/pic/digital_human.png)
実験結果
リサーチクエスチョン
- RQ1テキスト、音声、画像入力から、高品質でインタラクティブな2次元デジタル人間動画を効果的に生成できるマルチモーダル融合システムは、実現可能か?
- RQ2本システムは、年齢変換およびスタイル移行を伴うパーソナライズされたデジタル人間の生成において、どの程度の性能を示すか?
- RQ3既存のベンチマークと比較して、生成されたデジタル人間動画の視覚的および知覚的品質はどの程度か?
- RQ4人物に依存しないおよび人物に依存するドライブ手法の統合は、柔軟性および現実性をどの程度向上させるか?
- RQ5スーパーレゾリューションやスタイル移行といった後処理技術は、ユーザーエクスペリエンスの向上にどの程度効果的か?
主な発見
- 本システムは、顔面および全身アニメーションを含む、マルチモーダル入力(テキスト、音声、画像)から実にリアルな2次元デジタル人間動画を生成できることを、図3および図4で示した。
- 生成されたすべての動画の平均CPBDスコアは0.28以上であり、生成フレームのぼやけが少なく、シャープさが高いことを示している。
- CGIQA指標の平均はすべてのテストケースで0.57であった。これは、CGアニメーション品質評価において優れた性能を示している。
- VSFAスコアは0.8445から0.9893の範囲にあり、最高値0.9893は長髪の女性顔面で達成された。これは、知覚的動画品質が非常に高いことを示している。
- FAST-VQAスコアは常に0.6以上であり、最高値0.8802は短髪の女性顔面で達成された。これは、動画品質の知覚が強く、優れた性能であることを確認している。
- 本システムは、異なる顔貌タイプ、衣装、音声入力に対しても、強固な性能を示し、汎用性の高さが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。