[論文レビュー] Freeform Body Motion Generation from Speech
本論文では、共話の身体運動を確率的ポーズモードとプロソディー条件付きのリズミカルなダイナミクスに分離する2ストリーム拡散モデル、FreeMoを提案する。これにより、多様で高品質かつ音声に同期した自由形式の運動生成が可能になる。特にマルチスプーカーのデータで学習した場合、ベースラインを上回る運動の多様性、品質、同期性を達成する。
People naturally conduct spontaneous body motions to enhance their speeches while giving talks. Body motion generation from speech is inherently difficult due to the non-deterministic mapping from speech to body motions. Most existing works map speech to motion in a deterministic way by conditioning on certain styles, leading to sub-optimal results. Motivated by studies in linguistics, we decompose the co-speech motion into two complementary parts: pose modes and rhythmic dynamics. Accordingly, we introduce a novel freeform motion generation model (FreeMo) by equipping a two-stream architecture, i.e., a pose mode branch for primary posture generation, and a rhythmic motion branch for rhythmic dynamics synthesis. On one hand, diverse pose modes are generated by conditional sampling in a latent space, guided by speech semantics. On the other hand, rhythmic dynamics are synced with the speech prosody. Extensive experiments demonstrate the superior performance against several baselines, in terms of motion diversity, quality and syncing with speech. Code and pre-trained models will be publicly available through https://github.com/TheTempAccount/Co-Speech-Motion-Generation.
研究の動機と目的
- 音声から身体運動への非決定的で自由形式のマッピング、つまり音声から一意に定まらない運動の性質に取り組む。
- 運動をポーズモード(ポストラル・ステート)とリズミカルなダイナミクス(プロソディーに同期した運動)に分解し、それぞれを独立して確率的性質と同期性をモデル化する。
- スプーカー固有のスタイルや固定されたジェスチャー・テンプレートに依存せずに、高多様性の運動生成を可能にする。
- マルチスプーカーのデータで学習することで、スプーカー間の一般化を向上させつつ、強力な音声同期性を維持する。
提案手法
- 音声の意味をガイドとして、潜在空間における条件付きサンプリングにより多様なポーズを生成するVAEベースのポーズモードブランチを採用する。
- 高速でプロソディーにロックされた手の動きを推定する別個のリズミカルな運動ブランチを実装し、音声のエネルギーとピッチの変化を用いる。
- 運動の品質、多様性、音声同期性を統合したマルチタスク損失を用いて、2ストリームアーキテクチャをエンドツーエンドで学習する。
- マルチスプーカーの学習データを活用して、個々の人物間で共有される運動パターンを学習し、一般化性と多様性を向上させる。
- 高精細な運動サンプリングを実現するため、潜在空間で拡散ベースの生成プロセスを適用し、制御された確率的性質を実現する。
- 生成された2Dスケルトン系列をニューラルレンダラを用いてRGBフレームにマッピングすることで、エンドツーエンドのビデオレンダリングを実現する。
実験結果
リサーチクエスチョン
- RQ1音声から身体運動への非決定的マッピングを、ポーズモードとリズミカルなダイナミクスに分解することでモデル化可能か?
- RQ2ポーズ生成とリズミカルなダイナミクスを分離することで、運動の多様性と音声との同期性が向上するか?
- RQ3スプーカー固有の条件付けを必要とせず、1つのモデルが複数のスプーカーに一般化可能か?
- RQ4決定的ベースラインと比較して、自由形式で自然な動きを生成する性能はどの程度か?
- RQ5マルチスプーカーでの学習が、音声同期性を維持したまま運動の多様性をどの程度向上できるか?
主な発見
- FreeMoは、マルチスプーカーのデータで学習した場合、スプーカー固有のベースラインやテンプレートベースのベースラインと比較して、顕著に優れた運動の多様性を達成する。
- 1回の生成で、異なるスプーカーの多様なポーズを有する運動シーケンスを生成でき、最近接ネIGHボラの可視化で示されている。
- リズミカルなダイナミクスは音声プロソディーと効果的に同期しており、速い発話では速い動き、遅い発話では滑らかで落ち着いた動きが生成される。
- 複数のスプーカーで学習した場合でも、音声同期性を強く維持しており、スプーカー固有のモデルよりも同期メトリクスで優れた性能を示す。
- エンドツーエンドのビデオレンダリングにより、アマチュアの音声入力から「プロフェッショナル」な会話動画を生成可能であることが示された。
- 多様性と忠実度のトレードオフを示すように、多スプーカー学習では品質スコアがわずかに低下する傾向にある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。