[논문 리뷰] DreamWaltz: Make a Scene with Complex 3D Animatable Avatars
DreamWaltz는 SMPL 프라이어와 3D 일관성 SDS를 활용하여 자세 조건 애니메이션과 장면 구성을 retraining 없이 가능하게 하는 고품질, 애니메이션 가능한 3D 아바타를 생성하는 텍스트-투-아바타 프레임워크를 도입합니다.
We present DreamWaltz, a novel framework for generating and animating complex 3D avatars given text guidance and parametric human body prior. While recent methods have shown encouraging results for text-to-3D generation of common objects, creating high-quality and animatable 3D avatars remains challenging. To create high-quality 3D avatars, DreamWaltz proposes 3D-consistent occlusion-aware Score Distillation Sampling (SDS) to optimize implicit neural representations with canonical poses. It provides view-aligned supervision via 3D-aware skeleton conditioning which enables complex avatar generation without artifacts and multiple faces. For animation, our method learns an animatable 3D avatar representation from abundant image priors of diffusion model conditioned on various poses, which could animate complex non-rigged avatars given arbitrary poses without retraining. Extensive evaluations demonstrate that DreamWaltz is an effective and robust approach for creating 3D avatars that can take on complex shapes and appearances as well as novel poses for animation. The proposed framework further enables the creation of complex scenes with diverse compositions, including avatar-avatar, avatar-object and avatar-scene interactions. See https://dreamwaltz3d.github.io/ for more vivid 3D avatar and animation results.
연구 동기 및 목표
- 텍스트 프롬프트에서 쉽게 제어 가능하고 고품질이며 애니메이션 가능한 3D 아바타가 필요하다는 점을 동기 부여합니다.
- 인체 프라이어(SMPL)를 활용하여 3D 아바타 생성을 제약하고 가이드를 제공합니다.
- 일반적인 확산 기반 아티팩트를 피하기 위해 3D-일관성, 차폐를 고려한 감독을 개발합니다.
- retraining 없이 임의 자세로 재타깃 가능한 애니메이팅 NeRF 표현을 학습합니다.
- 아바타–아바타, 아바타–오브젝트, 아바타–장면 상호작용을 갖춘 장면 생성을 시연합니다.
제안 방법
- 3D 아바타 표현으로 학습 가능한 NeRF를 사용합니다.
- 초기화 및 확산 기반 SDS를 조건링하기 위한 3D 인식 골격 추출에 SMPL 프라이어를 활용합니다.
- 3D-일관성 스코어 증류 샘플링(Score Distillation Sampling)과 차폐 제거를 적용하여 일관된 3D 기하 구조를 보장하고 다중 얼굴 아티팩트를 피합니다.
- ControlNet을 통한 뼈대 기반 조건 이미지를 사용하여 SDS를 조건링하고 NeRF 렌더링과 시점을 정렬합니다.
- 재훈련 없이 자세 구동 변형이 가능하도록 밀도 가중 네트워크를 학습하여 애니메이팅 가능한 아바타를 만듭니다.
- 일반적인 자세로의 일반화를 위해 인간 포즈 프라이어(VPoser)를 도입합니다.
실험 결과
연구 질문
- RQ1텍스트 프롬프트로 어떤 고품질의 복잡한 3D 아바타를 임의의 자세에서 애니메이션 가능하게 생성할 수 있는가?
- RQ2SMPL 가이드 초기화와 3D 인식 SDS가 Octave 같은 문제를 줄이고 디테일을 보존하는가?
- RQ3추가 재훈련 없이 임의의 자세 시퀀스로 재타깃할 수 있도록 애니메이팅 가능한 NeRF를 학습할 수 있는가?
- RQ4확산 기반 감독을 사용하여 아바타–아바타, 아바타–오브젝트, 아바타–장면 상호작용이 가능한 복합 장면 구성이 feasible한가?
주요 결과
- DreamWaltz는 시점에 걸쳐 복잡한 모양과 텍스처를 갖춘 고품질 3D 아바타를 달성합니다.
- Occlusion-aware 3D-일관성 SDS는 시점 모호성 및 다중 얼굴 문제와 같은 아티팩트를 감소시킵니다.
- 포즈 조건부 확산 감독으로 학습된 애니메이팅 NeRF는 재훈련 없이 임의의 자세로 애니메이션화할 수 있습니다.
- 이 프레임워크는 아바타 및 기타 자산과의 장면 구성과 아바타–아바타, 아바타–장면 상호작용을 지원합니다.
- 사용자 연구에서 DreamWaltz 아바타가 기하학 및 텍스처 품질 면에서 베이스라인보다 뛰어납니다.
- 밀도 가중 네트워크는 비-피부-tight 아바타의 변형으로 인한 아티팩트를 완화하여 관절화를 안정화합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.