[论文解读] DreamWaltz: Make a Scene with Complex 3D Animatable Avatars
DreamWaltz 引入一个文本到头像框架,使用 SMPL 先验和 3D 一致的 SDS 来创建高质量、可动画的 3D 头像,以实现姿态条件的动画和场景合成,无需再次训练。
We present DreamWaltz, a novel framework for generating and animating complex 3D avatars given text guidance and parametric human body prior. While recent methods have shown encouraging results for text-to-3D generation of common objects, creating high-quality and animatable 3D avatars remains challenging. To create high-quality 3D avatars, DreamWaltz proposes 3D-consistent occlusion-aware Score Distillation Sampling (SDS) to optimize implicit neural representations with canonical poses. It provides view-aligned supervision via 3D-aware skeleton conditioning which enables complex avatar generation without artifacts and multiple faces. For animation, our method learns an animatable 3D avatar representation from abundant image priors of diffusion model conditioned on various poses, which could animate complex non-rigged avatars given arbitrary poses without retraining. Extensive evaluations demonstrate that DreamWaltz is an effective and robust approach for creating 3D avatars that can take on complex shapes and appearances as well as novel poses for animation. The proposed framework further enables the creation of complex scenes with diverse compositions, including avatar-avatar, avatar-object and avatar-scene interactions. See https://dreamwaltz3d.github.io/ for more vivid 3D avatar and animation results.
研究动机与目标
- 激发从文本提示得到易于控制的高质量、可动画的 3D 头像的需求。
- 利用人体先验(SMPL)来约束和引导 3D 头像生成。
- 开发 3D 一致、遮挡感知的监督,避免常见扩散模型的伪影。
- 学习一种可动画的 NeRF 表示,可以在无需再训练的情况下重新定向到任意姿态。
- 展示包含 avatar–avatar、avatar–object 和 avatar–scene 互动的场景创建。
提出的方法
- 使用可训练的 NeRF 作为 3D 头像表示。
- 利用 SMPL 先验进行初始化并提取与 3D 相关的骨架,用于对扩散式 SDS 条件化。
- 应用 3D 一致的 Score Distillation Sampling 并进行遮挡剔除,以确保连贯的 3D 几何并避免多面体伪影。
- 通过 ControlNet 使用基于骨架的条件图像对 SDS 进行条件化,以使视图与 NeRF 渲染对齐。
- 通过训练密度权重网络来学习可动画的头像,从而在不再训练的情况下实现姿态驱动的变形。
- 加入人类姿态先验(VPoser),将密度权重推广到任意姿态。
实验结果
研究问题
- RQ1文本提示能否生成高质量、复杂的 3D 头像,且可从任意姿态进行动画?
- RQ2以 SMPL 引导的初始化和 3D 感知的 SDS 能否在保留细节的同时减少像 Janus faces 之类的伪影?
- RQ3是否可以训练出可动画的 NeRF,使其在不额外重新训练的情况下重新定向到任意姿势序列?
- RQ4在使用扩散式监督下,是否可行将头像组合成包含 avatar–avatar、avatar–object、avatar–scene 的复杂场景?
主要发现
- DreamWaltz 在各视角下实现高质量的具有复杂形状和纹理的 3D 头像。
- 遮挡感知的 3D 一致 SDS 减少视角歧义和诸如多脸问题的伪影。
- 通过姿态条件扩散监督学习的可动画 NeRF 可以在不重新训练的情况下对任意姿态进行动画。
- 该框架支持与其他资产共同进行场景组合,并支持 avatar–avatar 与 avatar–scene 互动。
- 用户研究显示 DreamWaltz 头像在几何形状和纹理质量方面优于基线。
- 密度权重网络通过缓解非贴身头像的变换诱发伪影来稳定关节运动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。