Skip to main content
QUICK REVIEW

[論文レビュー] DisCo: Disentangled Control for Realistic Human Dance Generation

Tan Wang, Linjie Li|arXiv (Cornell University)|Jun 30, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

DisCoは、SNS風のダンス動画における一般化性と構成可能性を向上させる、分離制御フレームワークを提案する。VAEエンコーダーとクロスアテンション機構を用いて、前景(被写体)、背景、ポーズの制御信号を分離し、プロキシ再構成タスクを用いた事前学習により、人間の属性を学習することで、TikTokダンスデータセット上でFID 50.68、FVD 353.35の最先端性能を達成した。

ABSTRACT

Generative AI has made significant strides in computer vision, particularly in text-driven image/video synthesis (T2I/T2V). Despite the notable advancements, it remains challenging in human-centric content synthesis such as realistic dance generation. Current methodologies, primarily tailored for human motion transfer, encounter difficulties when confronted with real-world dance scenarios (e.g., social media dance), which require to generalize across a wide spectrum of poses and intricate human details. In this paper, we depart from the traditional paradigm of human motion transfer and emphasize two additional critical attributes for the synthesis of human dance content in social media contexts: (i) Generalizability: the model should be able to generalize beyond generic human viewpoints as well as unseen human subjects, backgrounds, and poses; (ii) Compositionality: it should allow for the seamless composition of seen/unseen subjects, backgrounds, and poses from different sources. To address these challenges, we introduce DISCO, which includes a novel model architecture with disentangled control to improve the compositionality of dance synthesis, and an effective human attribute pre-training for better generalizability to unseen humans. Extensive qualitative and quantitative results demonstrate that DisCc can generate high-quality human dance images and videos with diverse appearances and flexible motions. Code is available at https://disco-dance.github.io/.

研究の動機と目的

  • SNS風のダンス動画から多様で現実的なダンス動画を生成する際、従来の人体モーション転送手法が複雑なポーズ、未学習の被写体、新しい構成において失敗するという限界を解消する。
  • 標準的な訓練データを超えて、未学習の人体被写体、背景、ポーズへの一般化性を向上させる。
  • 異なるソースからの前景、背景、ポーズを任意に組み合わせることで、構成可能性を実現する。
  • 高品質なダンス動画データセットの不足を補うために、新しい人間属性事前学習戦略を導入する。

提案手法

  • VAEによる背景、軽量CNNによるポーズ、CLIP画像埋め込みによる人間被写体の別々のエンコーダーを用いた分離制御アーキテクチャを導入。これらはすべて、ノイズ除去U-Net内でのクロスアテンションにより統合される。
  • モデルが分離された前景および背景特徴から完全な画像を再構成するという、新しい人間属性事前学習(HAP)タスクを適用。これにより、未学習の人間属性に対する耐性が向上する。
  • Stable Diffusionの事前学習済みVQ-VAEを背景参照画像の符号化に活用。これにより、ランダムな畳み込み層よりも洗練された表現が可能になる。
  • HAP事前学習にポーズアノテーションを統合することで、テキスト条件付けからのポーズ制御を分離。ペアド画像・テキストデータへの依存度を低減する。
  • 参照画像(前景および背景を含む)を用いて、分類器フリー・ガイドランスを適用して微調整。生成の忠実度を向上させる。
  • 大規模かつペアリングのない人間画像コレクションをHAP事前学習に活用。これにより、未学習の人物へのゼロショット一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルは、未学習の被写体、背景、ポーズへ一般化可能な高精細で制御可能なダンス生成を達成できるか?
  • RQ2被写体、背景、ポーズの制御信号を分離することで、動画生成における構成可能性が向上するか?
  • RQ3分離された前景および背景特徴から画像を再構成するプロキシ事前学習タスクは、ペアドダンス動画データが不要な状況でも一般化性を向上させられるか?
  • RQ4背景エンコーダーの選択(例:VQ-VAE対ランダム畳み込み層)が合成品質および一貫性に与える影響は?
  • RQ5テキスト-to-画像生成から得た事前学習済みチェックポイントをポーズControlNetに初期化すると、画像参照ベースのダンス生成における性能が低下するか?

主な発見

  • DisCoはTikTokダンスデータセット上でFID 50.68を達成し、ベースラインのDisCo(61.06)やアブレーションモデルを顕著に上回った。
  • 人間属性事前学習(HAP)を適用した結果、FVDが353.35に低下し、動画レベルの忠実度および時間的一貫性が向上した。
  • 事前学習済みVQ-VAEを背景符号化に使用することで、FIDは83.53(ランダム畳み込み層)から65.14に低下し、意味的豊かな表現の利点が裏付けられた。
  • HAPと組み合わせた際、事前学習済みControlNet-PoseチェックポイントをポーズControlNetに初期化すると、ランダムなU-Net重みを使用した場合より性能が悪化した。これはドメイン不一致の兆候である。
  • アブレーション実験から、HAPにポーズを統合しても、HAPにポーズを含めない場合と同等の性能が得られるが、追加のアノテーション作業が発生する。これは、HAPの利点にとってポーズが必須ではないことを示唆している。
  • スケール1.5の分類器フリー・ガイドランスが、画像および動画のメトリクスにおいて最良の定量的結果をもたらした。これにより、多様性と忠実度の最適なトレードオフが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。