Skip to main content
QUICK REVIEW

[논문 리뷰] AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars

Fangzhou Hong, Mingyuan Zhang|arXiv (Cornell University)|2022. 05. 17.
Human Motion and AnimationEngineering인용 수 18
한 줄 요약

AvatarCLIP는 자연어 기반 기술 설명만으로도 3D 애벌러를 생성하고 애니메이션하는 제로샷, 텍스트 기반 프레임워크를 도입한다. 비전-언어 감독을 위해 CLIP를 활용하고, 형태/운동 VAE를 신경 렌더링과 결합함으로써 전문가 입력이나 쌍화된 훈련 데이터 없이도 고해상도로 애니메이션 가능한 3D 애벌러를 생성할 수 있으며, 다양한 텍스트 프롬프트에 대해 강력한 제로샷 일반화 성능을 달성한다.

ABSTRACT

3D avatar creation plays a crucial role in the digital age. However, the whole production process is prohibitively time-consuming and labor-intensive. To democratize this technology to a larger audience, we propose AvatarCLIP, a zero-shot text-driven framework for 3D avatar generation and animation. Unlike professional software that requires expert knowledge, AvatarCLIP empowers layman users to customize a 3D avatar with the desired shape and texture, and drive the avatar with the described motions using solely natural languages. Our key insight is to take advantage of the powerful vision-language model CLIP for supervising neural human generation, in terms of 3D geometry, texture and animation. Specifically, driven by natural language descriptions, we initialize 3D human geometry generation with a shape VAE network. Based on the generated 3D human shapes, a volume rendering model is utilized to further facilitate geometry sculpting and texture generation. Moreover, by leveraging the priors learned in the motion VAE, a CLIP-guided reference-based motion synthesis method is proposed for the animation of the generated 3D avatar. Extensive qualitative and quantitative experiments validate the effectiveness and generalizability of AvatarCLIP on a wide range of avatars. Remarkably, AvatarCLIP can generate unseen 3D avatars with novel animations, achieving superior zero-shot capability.

연구 동기 및 목표

  • 전문 소프트웨어와 전문 지식이 필요 없이 3D 애벌러 생성을 민주화하기 위해.
  • 감독 훈련을 위한 고품질의 텍스트 조건부 3D 애벌러 데이터셋 부족 문제를 해결하기 위해.
  • 자연어만을 사용하여 새로운 3D 애벌러와 동작을 제로샷으로 생성하기 위해.
  • 신경 렌더링과 운동 사전 지식을 통해 생성된 애벌러가 기하학적으로 정확하고 텍스처가 있으며 애니메이션 가능하도록 보장하기 위해.
  • 쌍화된 데이터에 의존하거나 일반화 성능이 열악한 기존 방법의 한계를 극복하기 위해.

제안 방법

  • 텍스트 기반으로 CLIP 임bedding을 통해 안내받는 형태 VAE를 사용하여 3D 인간 기하 구조를 초기화한다.
  • 신경 렌더링를 통해 렌더링된 이미지에 CLIP 감독을 적용하여 텍스처와 기하 구조를 최적화한다.
  • 최적화 과정에서 템플릿 메쉬 제약 조건을 적용하여 타당한 인간 형태를 유지한다.
  • 텍스트 기반 기반의 참조 기반 합성을 위한 CLIP 유도 운동 VAE를 사용하여 운동 시퀀스를 생성한다.
  • 잠재 공간 최적화를 통해 후보 자세를 생성하고, CLIP 기반 자세 일致성 손실을 사용하여 이를 정밀하게 조정한다.
  • 암묵적 표현에서 명시적 메쉬를 추출하여 후속 애니메이션 및 렌더링을 위해 사용한다.

실험 결과

연구 질문

  • RQ1쌍화된 훈련 데이터나 전문가 입력 없이도 제로샷, 텍스트 기반 방법이 다양한 고품질 3D 애벌러를 생성할 수 있는가?
  • RQ2렌더링된 이미지에 적용된 CLIP 감독이 기하 구조와 텍스처 생성을 얼마나 잘 이끌 수 있는가?
  • RQ3운동 VAE 사전 지식과 CLIP를 결합하면 운동-텍스트 쌍화된 데이터 없이도 현실적이고 텍스트에 부합하는 운동 합성을 가능하게 할 수 있는가?
  • RQ4이 방법은 새로운 애벌러와 복잡한 운동 기술 기술에 대해 얼마나 잘 일반화되는가?
  • RQ5CLIP의 고정된 텍스트 인코딩으로 인해 동일한 프롬프트에서 다양한 결과를 생성하는 데에 어떤 한계가 있는가?

주요 결과

  • AvatarCLIP는 뛰어난 제로샷 일반화 성능을 달성하여 자연어 프롬프트만으로 다양한 형태, 텍스처, 운동을 가진 새로운 3D 애벌러를 생성한다.
  • qualitative 비교를 통해 Text2Mesh와 Dream Field에 비해 명확한 우수성을 보이며 고품질의 기하 구조와 텍스처를 생성한다.
  • 직접 최적화나 다중 모odal Real NVP에서의 샘플링에 비해 운동 합성 성능이 뛰어나 사용자 연구에서 높은 점수를 기록한다.
  • 다양한 랜덤 시드로 반복 실행한 결과 일관된 결과를 보이며, Text2Mesh와 같이 불안정한 기준 모델에 비해 강건함을 입증한다.
  • 유명인 이름, 환상적 캐릭터, 의복 및 외형에 대한 세부 기술 등 다양한 입력을 성공적으로 처리한다.
  • 복잡한 운동과 세밀한 제어에 대해서는 실패 케이스가 발생하여, 분포 외 또는 매우 스타일리시한 동작 생성에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.