Skip to main content
QUICK REVIEW

[논문 리뷰] Articulated 3D Head Avatar Generation using Text-to-Image Diffusion Models

Alexander W. Bergman, Yifan Wang|arXiv (Cornell University)|2023. 07. 10.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 사전 훈련된 2D 텍스트-이미지 확산 모델을 사용하여 텍스트 프롬프트에서 조작 가능한 3D 머리 아바타를 생성하는 새로운 방법을 제안한다. 이중의 계획된 최적화 과정을 통해 파arametric 3D 모러포블 모델(3DMM)의 기하학적 구조와 질감을 동시에 최적화함으로써, 시각적으로 일관되고 애니메이션 가능한 사진 수준의 현실감 있는 머리 아바타를 생성한다. 이는 의미적 일치도와 다양성 측면에서 CLIP 기반 기준 모델보다 뛰어난 성능을 보인다.

ABSTRACT

The ability to generate diverse 3D articulated head avatars is vital to a plethora of applications, including augmented reality, cinematography, and education. Recent work on text-guided 3D object generation has shown great promise in addressing these needs. These methods directly leverage pre-trained 2D text-to-image diffusion models to generate 3D-multi-view-consistent radiance fields of generic objects. However, due to the lack of geometry and texture priors, these methods have limited control over the generated 3D objects, making it difficult to operate inside a specific domain, e.g., human heads. In this work, we develop a new approach to text-guided 3D head avatar generation to address this limitation. Our framework directly operates on the geometry and texture of an articulable 3D morphable model (3DMM) of a head, and introduces novel optimization procedures to update the geometry and texture while keeping the 2D and 3D facial features aligned. The result is a 3D head avatar that is consistent with the text description and can be readily articulated using the deformation model of the 3DMM. We show that our diffusion-based articulated head avatars outperform state-of-the-art approaches for this task. The latter are typically based on CLIP, which is known to provide limited diversity of generation and accuracy for 3D object generation.

연구 동기 및 목표

  • 기존의 텍스트 기반 3D 생성 방법에서 인간의 머리에 대한 제어력과 현실감의 부족을 해결한다.
  • 조작이 어렵고 도메인 특화 제어가 어려운 레디언스 필드 표현 방식의 한계를 극복한다.
  • 고도로 의미적인 정확도를 유지할 수 있도록 2D 텍스트-이미지 확산 모델을 사전 지식으로 활용하여 3D 머리 아바타 생성을 유도한다.
  • 파arametric 3DMM에서 형태와 외관을 직접 최적화하여 애니메이션 가능한 아바타를 생성한다.
  • CLIP 기반 접근 방식이 의미적 일치도가 낮고 다양성이 떨어지는 데 비해, 생성의 다양성과 정확성을 향상시킨다.

제안 방법

  • 기하학적 구조와 질감 최적화를 위한 미분 가능한 템플릿으로 파arametric 3D 모러포블 모델(3DMM)을 사용한다.
  • 뷰 일관성 있는 이미지를 생성하기 위해 잠재 확산 모델 디코더를 사용해 정점 위치와 질감 특징 맵을 최적화한다.
  • 두 단계로 나누어 계획된 최적화를 적용한다: 먼저 질감 최적화를 수행하고, 이후 기하학적 구조와 외관을 동시에 개선한다.
  • 예측된 실루엣을 텍스트 프롬프트와 일치시키기 위해 분할 기반의 감독 손실($\mathcal{L}_{\textrm{seg}}$)을 적용한다.
  • 렌더링 파이프라인에 알파 블렌딩 조명 측정을 통합하여 기하학적 구조와 질감의 일관성 및 얼굴 기능 정렬을 향상시킨다.
  • 여러 CLIP 모델을 통해 텍스트-이미지 일관성을 평가하기 위해 CLIP-R 점수를 활용하고, 점수 분산 기반 최적화를 유도한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 2D 텍스트-이미지 확산 모델이 명시적인 기하학적 구조와 질감을 갖춘 다양한 3D 뷰 일관성 있는 머리 아바타 생성에 효과적으로 활용될 수 있는가?
  • RQ2질감 최적화를 먼저 수행하고, 이후 기하학적 구조와 외관을 동시에 개선하는 계획된 최적화 방식이 생성 품질과 안정성 향상에 기여하는가?
  • RQ3분할 및 조명 측정을 통합함으로써 기하학적 일관성과 얼굴 기능 정렬이 얼마나 향상되는가?
  • RQ4의미적 일치도와 시각적 품질 측면에서 제안된 방법은 CLIP 기반 기준 모델에 비해 어느 정도 뛰어나게 되는가?
  • RQ5제안된 방법으로 생성된 아바타는 3DMM 변형 모델을 사용해 효과적으로 애니메이션되며, 프롬프트 일관성이 유지되는가?

주요 결과

  • 제안된 방법은 모든 프롬프트 평균에서 CLIP-R 점수 83.2를 기록하여, 두 번째로 우수한 기준 모델인 ClipFace보다 8.2점 높게 기록했다.
  • 절단 실험 결과, 분할 손실($\mathcal{L}_{\textrm{seg}}$)을 제거할 경우 기하학적 일관성이 떨어지며, 기하학적 측면에서 CLIP-R 점수가 1.7점 하락함을 확인했다.
  • 계획된 최적화를 생략할 경우 평균 CLIP-R 점수가 4.4점 하락하여, 안정적인 수렴을 위해 이 과정이 매우 중요함을 입증했다.
  • 조명 측정을 생략할 경우 얼굴 기능 정렬이 어긋나며, 기하학적 측면에서 CLIP-R 점수가 14.1점 하락함을 확인하여, 이 요소가 기하학적 최적화를 유도하는 데 핵심적인 역할을 함을 입증했다.
  • 시각적 결과는 전체 방법이 정확한 얼굴 기능, 일관성 있는 질감, 복잡한 프롬프트(예: '날카로운 모자 쓴 마법사')와의 정확한 일치를 보이는 아바타를 생성함을 보여준다.
  • 이 방법은 이전 방법으로는 쉽게 구현되지 않는 다양한 스타일링되고 환상적인 인간형 머리 아바타를 성공적으로 생성하여, 광범위한 프롬프트 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.