Skip to main content
QUICK REVIEW

[論文レビュー] Dancing Avatar: Pose and Text-Guided Human Motion Videos Synthesis with Image Diffusion Model

Bosheng Qin, Wentao Ye|arXiv (Cornell University)|Aug 15, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

Dancing Avatar は、ポーズシーケンスとテキストプロンプトによってガイドされた、事前学習済みテキストから画像への(T2I)拡散モデルを用いて、高品質で時間的に整合性のある人間の動きの動画を生成するための新しいフレームワークを提案する。フレーム内、フレーム間、および背景のアライメントモジュールを導入することで、最先端のテキストから動画への手法と比較して、優れた動画品質、外見の一貫性、時間的整合性を達成した。

ABSTRACT

The rising demand for creating lifelike avatars in the digital realm has led to an increased need for generating high-quality human videos guided by textual descriptions and poses. We propose Dancing Avatar, designed to fabricate human motion videos driven by poses and textual cues. Our approach employs a pretrained T2I diffusion model to generate each video frame in an autoregressive fashion. The crux of innovation lies in our adept utilization of the T2I diffusion model for producing video frames successively while preserving contextual relevance. We surmount the hurdles posed by maintaining human character and clothing consistency across varying poses, along with upholding the background's continuity amidst diverse human movements. To ensure consistent human appearances across the entire video, we devise an intra-frame alignment module. This module assimilates text-guided synthesized human character knowledge into the pretrained T2I diffusion model, synergizing insights from ChatGPT. For preserving background continuity, we put forth a background alignment pipeline, amalgamating insights from segment anything and image inpainting techniques. Furthermore, we propose an inter-frame alignment module that draws inspiration from an auto-regressive pipeline to augment temporal consistency between adjacent frames, where the preceding frame guides the synthesis process of the current frame. Comparisons with state-of-the-art methods demonstrate that Dancing Avatar exhibits the capacity to generate human videos with markedly superior quality, both in terms of human and background fidelity, as well as temporal coherence compared to existing state-of-the-art approaches.

研究の動機と目的

  • 時間的整合性があり外見の一貫性を持つ高品質な人間の動きの動画を生成するテキストから動画への(T2V)拡散モデルの限界を克服すること。
  • 微調整された T2V モデルで見られる品質の低下を回避するために、事前学習済みのテキストから画像への(T2I)拡散モデルを動画合成に活用すること。
  • 変化するポーズや動的な動きに対しても、フレーム間での人間の外見の一貫性を保証すること。
  • 人間の動きの合成中に、フレーム間での背景の一貫性を維持すること。
  • 自己回帰的およびアライメント機構を用いて、隣接するフレーム間の時間的整合性を向上させること。

提案手法

  • フレームを自己回帰的に生成するためのフレームワークで、ポーズシーケンスとテキストプロンプトを条件とする事前学習済み T2I 拡散モデルを用いる。
  • フレーム内アライメントモジュールは、ChatGPT から得たテキストガイド付きの人間キャラクターの知識を T2I モデルに統合し、フレーム間での外見の安定化を図る。
  • 背景アライメントパイプラインは、Segment Anything と画像補完技術を組み合わせ、フレーム間での一貫性のある背景を維持する。
  • フレーム間アライメントモジュールは、直前のフレームを条件付きガイドとして用いることで、時間的整合性を強化する。
  • ベースの拡散アーキテクチャを再訓練せずに、T2I モデルへの微調整を統合し、外見および背景の一貫性を埋め込む。
  • パイプラインは各フレームを逐次処理し、入力ポーズおよびテキストに一致させつつ、グローバルなシーンの一貫性を保つ。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みテキストから画像への(T2I)拡散モデルを、高品質で時間的に整合性のある人間の動きの動画生成に効果的に再利用できるか?
  • RQ2ポーズシーケンスとテキストプロンプトから動画を合成する際、外見の一貫性をどのように維持できるか?
  • RQ3動的な人間の動きの合成中に、背景の一貫性を保つためにどのようなメカニズムが必要か?
  • RQ4フレーム間ガイド付きの自己回帰的フレーム生成は、動画合成における時間的整合性をどの程度向上できるか?
  • RQ5フレーム内、フレーム間、および背景アライメントモジュールが、総合的に動画品質および一貫性をどのように向上させるか?

主な発見

  • Dancing Avatar は、最小のポーズ MSE(0.0012)と最大のテキストアライメント CLIP スコア(0.891)を記録し、入力条件のアライメントが優れていることを示している。
  • モデルは最小のフレーム MSE(0.0041)とフレーム L1(0.021)を記録し、隣接するフレーム間の強い時間的整合性を示している。
  • ボディ CLIP スコア(0.852)と背景 CLIP スコア(0.876)が最高を記録しており、時間経過に伴うコンテンツの統合性が向上していることを確認している。
  • アブレーションスタディでは、フレーム内アライメントモジュールを削除すると、ボディ CLIP スコアが 0.065 減少し、外見の一貫性が著しく低下することが判明した。
  • フレーム間アライメントモジュールが欠落すると、フレーム MSE が 0.0018、フレーム L1 が 0.0032 増加し、詳細レベルの整合性に果たす役割が明確になった。
  • 背景アライメントは極めて重要である:これを省略すると、背景 CLIP スコアが 0.112 減少し、フレーム間で急激かつ一貫性のない背景の変化が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。