Skip to main content
QUICK REVIEW

[論文レビュー] DreamWaltz: Make a Scene with Complex 3D Animatable Avatars

Yukun Huang, Jianan Wang|arXiv (Cornell University)|May 21, 2023
Human Motion and Animation被引用数 16
ひとこと要約

DreamWaltz は SMPL priors と 3D-consistent SDS を用いて、再訓練なしでポーズ条件付きのアニメーションとシーン構成を可能にする、高品質でアニメーション可能な 3D アバターを作成する text-to-avatar フレームワークを導入します。

ABSTRACT

We present DreamWaltz, a novel framework for generating and animating complex 3D avatars given text guidance and parametric human body prior. While recent methods have shown encouraging results for text-to-3D generation of common objects, creating high-quality and animatable 3D avatars remains challenging. To create high-quality 3D avatars, DreamWaltz proposes 3D-consistent occlusion-aware Score Distillation Sampling (SDS) to optimize implicit neural representations with canonical poses. It provides view-aligned supervision via 3D-aware skeleton conditioning which enables complex avatar generation without artifacts and multiple faces. For animation, our method learns an animatable 3D avatar representation from abundant image priors of diffusion model conditioned on various poses, which could animate complex non-rigged avatars given arbitrary poses without retraining. Extensive evaluations demonstrate that DreamWaltz is an effective and robust approach for creating 3D avatars that can take on complex shapes and appearances as well as novel poses for animation. The proposed framework further enables the creation of complex scenes with diverse compositions, including avatar-avatar, avatar-object and avatar-scene interactions. See https://dreamwaltz3d.github.io/ for more vivid 3D avatar and animation results.

研究の動機と目的

  • テキストプロンプトから、容易に制御可能で高品質かつアニメーション可能な 3D アバターを生成する必要性を動機づける。
  • 人間の体プリオリ(SMPL)を活用して、3D アバター生成を制約・誘導する。
  • 3D-consistentでオクルージョン対応の監視を開発し、拡散ベースのアーティファクトを回避する。
  • 再訓練なしに任意のポーズへリターゲット可能なアニメーション可能な NeRF 表現を学習する。
  • アバター同士、アバターとオブジェクト、アバターとシーンの相互作用を備えたシーン作成を実証する。

提案手法

  • 3D アバター表現として trainable NeRF を使用する。
  • 初期化と拡散ベースの SDS の conditioning のために SMPL priors を用い、3D-aware なスケルトンを抽出する。
  • 3D-consistent Score Distillation Sampling を occlusion culling と共に適用し、一貫した 3D 幾何とマルチフェースアーティファクトを回避する。
  • ControlNet を介したスケルトンベースの conditioning 画像で SDS を条件付けし、NeRF レンダリングとビューを整合させる。
  • 密度ウェイトネットワークを訓練してポーズ駆動の変形を再訓練なしで可能にし、アニメーション可能なアバターを学習する。
  • 人体ポーズプリオリ(VPoser)を組み込み、密度ウェイトの一般化を任意のポーズへ拡張する。

実験結果

リサーチクエスチョン

  • RQ1テキストプロンプトは、任意のポーズからアニメーション可能な高品質で複雑な 3D アバターを生成できるか。
  • RQ2SMPL-guided initialization と 3D-aware SDS は、Janus 顔のようなアーティファクトを抑えつつディテールを維持できるか。
  • RQ3アニメーション可能な NeRF を訓練して、追加の再訓練なしで任意のポーズ列へリターゲットできるか。
  • RQ4拡散ベースの監視を用いたアバター同士・アバターとオブジェクト・アバターとシーンの多様な相互作用を含む複雑なシーンの構成が現実的か。

主な発見

  • DreamWaltz は、さまざまな視点で複雑な形状とテクスチャを持つ高品質な 3D アバターを実現する。
  • オクルージョン対応の 3D-consistent SDS は視点の曖昧さとマルチフェースのようなアーティファクトを減らす。
  • ポーズ条件付き拡散監視で学習したアニメーション可能な NeRF は、再訓練なしで任意のポーズへリターゲット可能である。
  • このフレームワークはアバターと他の資産を組み合わせたシーン構成を実現し、アバター同士およびアバターとシーンの相互作用をサポートする。
  • ユーザースタディは、DreamWaltz アバターがジオメトリとテクスチャ品質の点でベースラインを上回ることを示した。
  • 密度ウェイト網は、非スキンタイツのアバターでの変形誘発アーティファクトを緩和することにより、可動性を安定させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。