[논문 리뷰] SEEAvatar: Photorealistic Text-to-3D Avatar Generation with Constrained Geometry and Appearance
SEEAvatar는 자기진화하는 제약 조건을 사용하여 기하학적 구조와 외관을 분리하고 향상시키는 사진처럼 생긴 텍스트 기반 3D 아바타 생성 방법을 제안한다. 전역적인 형태 제어를 위해 진화하는 템플릿 아바타와 국소적 세부 사항을 위한 정적 인간 사전 지식을 조합하고, 확산 기반 외관 모델링에 밝기 제약 조건을 적용함으로써 고해상도 메쉬와 텍스처를 생성한다. 이는 고전적인 그래픽스 파이프라인에서 사진처럼 생긴 렌더링을 가능하게 하며, 기하학적 구조와 외관 품질 측면에서 이전 방법들을 능가한다.
Powered by large-scale text-to-image generation models, text-to-3D avatar generation has made promising progress. However, most methods fail to produce photorealistic results, limited by imprecise geometry and low-quality appearance. Towards more practical avatar generation, we present SEEAvatar, a method for generating photorealistic 3D avatars from text with SElf-Evolving constraints for decoupled geometry and appearance. For geometry, we propose to constrain the optimized avatar in a decent global shape with a template avatar. The template avatar is initialized with human prior and can be updated by the optimized avatar periodically as an evolving template, which enables more flexible shape generation. Besides, the geometry is also constrained by the static human prior in local parts like face and hands to maintain the delicate structures. For appearance generation, we use diffusion model enhanced by prompt engineering to guide a physically based rendering pipeline to generate realistic textures. The lightness constraint is applied on the albedo texture to suppress incorrect lighting effect. Experiments show that our method outperforms previous methods on both global and local geometry and appearance quality by a large margin. Since our method can produce high-quality meshes and textures, such assets can be directly applied in classic graphics pipeline for realistic rendering under any lighting condition. Project page at: https://yoxu515.github.io/SEEAvatar/.
연구 동기 및 목표
- 기존의 텍스트 기반 3D 아바타 생성 방법이 전역적 형태, 국소적 세부 사항, 조명 현실성 측면에서 낮은 품질을 보이는 데 대한 한계를 해결하기 위해.
- 기하학적 구조와 외관을 분리하여 내보낼 수 있는 메쉬와 텍스처로 구성된 고해상도 PBR 준비 자산을 제공함으로써 사진처럼 생긴 3D 아바타 생성을 가능하게 하기 위해.
- 진화하는 템플릿 아바타를 통한 전역적 형태 제약과 정적 인간 사전 지식을 통한 국소적 특징(예: 얼굴과 손) 제약을 통해 형태의 정확도와 구조적 세부 사항을 향상시키기 위해.
- 확산 기반 외관 생성에 밝기 제약 조건을 도입하여 알베도 텍스처에 포함된 잘못된 조명 효과를 억제함으로써 PBR 파이프라인에 적합한 현실적인 알베도 표현을 확보하기 위해.
- 확산 파이프라인 내에서 프롬프트 엔지니어링과 균일한 스케일링을 통해 아티팩트와 과도한 채도를 감소시켜 외관 품질을 향상시키기 위해.
제안 방법
- 자기진화하는 템플릿 아바타를 사용하여 현재 아바타의 전역적 형태를 부호 거리 함수(SDF) 및 법선 제약 조건을 통해 제약함으로써 인간 사전 지식에 기반한 영역에 맞는 형태 생성이 가능하다.
- 최적화된 현재 아바타를 주기적으로 이용해 템플릿 아바타를 업데이트함으로써 다양한 형태(예: 다른 옷 스타일)에 적응하면서도 구조적 통합성을 유지한다.
- 얼굴과 손과 같은 고해상도 영역에서 국소적 기하학적 구조를 정확히 유지하기 위해 정적 인간 사전 지식(SMPL-X 등)을 적용한다.
- 외관 생성에 확산 모델을 사용하며, 양성 및 음성 프롬프트 엔지니어링을 통해 텍스처 품질과 세부 사항의 풍부함을 향상시킨다.
- 알베도 텍스처에 밝기 제약 조건을 적용하여 렌더링된 조명 효과를 억제함으로써 PBR 파이프라인에 적합한 현실적인 알베도 표현을 확보한다.
- 확산 추론 중 균일한 스케일링을 강제하여 깊이 차원의 아티팩트를 방지함으로써 텍스처의 일관성과 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1자기진화하는 템플릿 아바타는 인간 사전 지식 제약 조건을 유지하면서도 텍스트 기반 3D 아바타 생성에서 전역적 형태의 정확도와 다양성을 향상시킬 수 있는가?
- RQ2탄력적인 형태 생성 조건 하에서 손과 얼굴과 같은 국소적 기하학적 세부 사항은 어떻게 유지될 수 있는가?
- RQ3확산 모델 내에서 프롬프트 엔지니어링과 밝기 제약 조건을 통해 조명 아티팩트를 어느 정도 줄일 수 있으며, 알베도의 현실감을 향상시킬 수 있는가?
- RQ4분리된 기하학적 구조 및 외관 생성 방식은 다양한 조명 조건 하에서도 현실적인 렌더링을 지원하는 PBR 준비 자산을 생성할 수 있는가?
- RQ5SDF 및 법선 제약 조건은 고해상도 DMTet 표현에서 표면의 매끄러움과 고해상도 메쉬 품질에 어떻게 기여하는가?
주요 결과
- SEEAvatar는 전역적 및 국소적 기하학적 구조 품질에서 최신 기술 수준의 성능을 달성하였으며, 인간 평가 결과 모든 지표에서 DreamWaltz 및 TADA보다 유의미하게 높은 점수를 기록하였다.
- 제거 실험을 통해 SDF 및 법선 제약 조건가 전역적 형태 유지와 표면의 매끄러움을 확보하는 데 필수적임을 확인하였으며, 특히 고해상도 테트라하드럴 메쉬를 사용할 경우 더욱 두드러진다.
- 진화하는 템플릿 아바타 덕분에 원래의 SMPL-X 사전 지식을 초월한 다양한 형태의 아바타(장식의 드레스나 고유한 헤어 스타일을 가진 아바타 등)를 생성할 수 있었으며, 고정된 템플릿을 사용할 경우 이러한 형태는 실패하였다.
- 밝기 제약 조건은 알베도 텍스처 내 가짜 반사광과 비균일한 조명 효과를 효과적으로 억제하여 더 정확하고 현실적인 PBR 재질을 만들어냈다.
- 음성 프롬프트와 균일한 스케일링은 과도한 채도와 줄무늬 아티팩트를 감소시켜 외관의 현실감과 텍스처의 일관성을 향상시켰다.
- 고품질의 메쉬와 텍스처를 갖춘 생성된 아바타들은 렌더링 재조정, 포즈 설정, 사진처럼 생긴 렌더링을 위해 Blender 및 기타 그래픽 도구에서 직접 사용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.