Skip to main content
QUICK REVIEW

[논문 리뷰] RenderMe-360: A Large Digital Asset Library and Benchmarks Towards High-fidelity Head Avatars

Dongwei Pan, Zhuo Long|arXiv (Cornell University)|2023. 05. 22.
Face recognition and analysis인용 수 5
한 줄 요약

RenderMe-360는 500명의 다양한 신체적 정체성을 가진 인물들로부터 30 FPS에서 60대의 동기화된 2K 카메라를 사용해 촬영한 24300만 개 이상의 헤드 프레임을 포함한 대규모 고해상도 4D 디지털 자산 라이브러리를 제공한다. 이는 16개의 최신 기술 기반 방법에 대해 다섯 가지 핵심 과제—새로운 시점 및 표정 합성, 헤어 렌더링, 편집, 대화형 헤드 생성—에서 종합적인 벤치마킹을 가능하게 하여 현재 모델들이 다양한 실제 조건에서 견고성과 일반화 능력에 심각한 격차를 보이고 있음을 드러낸다.

ABSTRACT

Synthesizing high-fidelity head avatars is a central problem for computer vision and graphics. While head avatar synthesis algorithms have advanced rapidly, the best ones still face great obstacles in real-world scenarios. One of the vital causes is inadequate datasets -- 1) current public datasets can only support researchers to explore high-fidelity head avatars in one or two task directions; 2) these datasets usually contain digital head assets with limited data volume, and narrow distribution over different attributes. In this paper, we present RenderMe-360, a comprehensive 4D human head dataset to drive advance in head avatar research. It contains massive data assets, with 243+ million complete head frames, and over 800k video sequences from 500 different identities captured by synchronized multi-view cameras at 30 FPS. It is a large-scale digital library for head avatars with three key attributes: 1) High Fidelity: all subjects are captured by 60 synchronized, high-resolution 2K cameras in 360 degrees. 2) High Diversity: The collected subjects vary from different ages, eras, ethnicities, and cultures, providing abundant materials with distinctive styles in appearance and geometry. Moreover, each subject is asked to perform various motions, such as expressions and head rotations, which further extend the richness of assets. 3) Rich Annotations: we provide annotations with different granularities: cameras' parameters, matting, scan, 2D/3D facial landmarks, FLAME fitting, and text description. Based on the dataset, we build a comprehensive benchmark for head avatar research, with 16 state-of-the-art methods performed on five main tasks: novel view synthesis, novel expression synthesis, hair rendering, hair editing, and talking head generation. Our experiments uncover the strengths and weaknesses of current methods. RenderMe-360 opens the door for future exploration in head avatars.

연구 동기 및 목표

  • AR/VR 및 메타버스 분야에서 인간 헤드 애벌러 연구를 위한 대규모, 다양한, 고해상도 4D 데이터셋의 부족을 해결한다.
  • 기존 데이터셋이 규모가 작고, 특성 다양성(예: 연령, 민족, 표정, 액세서리)이 제한적이며, 애너테이션이 흐릿한 점을 극복한다.
  • 새로운 시점 합성, 표정 이행, 대화형 헤드 생성과 같은 다양한 후행 과제에서의 종합적 벤치마킹을 가능하게 한다.
  • 풍부한 다중모odal 애너테이션을 갖춘 통합된 공개 데이터셋을 통해 견고하고 일반화 능력이 뛰어난 헤드 애벌러 생성 및 편집 모델 개발을 지원한다.
  • 세밀한 수준의 다중 레벨 애너테이션을 활용해 텍스트 기반 3D 헤드 생성, 역방향 렌더링, 다중모달 애벌러 합성 분야의 차세대 연구를 지원한다.

제안 방법

  • 60대의 동기화된 2K 산업용 카메라를 사용해 360도 포트레이트 데이터를 30 FPS에서 고사실감과 기하학적 정확도를 확보한 고성능 데이터 수집 시스템인 POLICY를 구축한다.
  • 다양한 연령, 민족, 문화, 표현 행동을 포함한 500명의 다양한 피험자를 대상으로 데이터를 수집하며, 각 피험자에게는 12종의 최고 수준의 표정, 42개의 双어성 대화, 최대 12종의 헤어스타일을 포함한다.
  • 다양한 해상도의 애너테이션을 생성: 2D/3D 얼굴 랜드마크, 배경 마스킹, 3D 헤드 스캔, FLAME 피팅, 동기화된 오디오, 각 프레임에 대한 텍스트 기술서.
  • 새로운 시점 합성, 새로운 표정 합성, 헤어 렌더링, 헤어 편집, 대화형 헤드 생성의 다섯 가지 핵심 과제에서 16개의 최신 기술 기반 방법을 평가하는 종합적인 벤치마크를 구축한다.
  • Latent-NeRF 및 TEXTure 등의 방법을 활용해 텍스트 기반 3D 생성 실험에서 기하학적 사전 지식(예: 3D 스캔)과 텍스트 가이던스(예: CLIP)를 통합한다.
  • 표준화된 데이터 처리 파이프라인(예: 랜드마크 검출, 얼굴 분할, 영상 자르기)을 적용해 훈련 및 평가 과정에서 일관성과 정확성을 확보한다.

실험 결과

연구 질문

  • RQ1현재 최신 기술 기반 헤드 애벌러 생성 모델은 대규모 고해상도 4D 데이터셋에서 다양한 정체성, 표정, 헤드 포즈 조건에서 어떻게 성능을 발휘하는가?
  • RQ2기존 방법은 다양한 헤어스타일, 메이크업, 액세서리와 같은 복잡한 특성에 얼마나 잘 일반화되는가?
  • RQ3고해상도이고 다양한 헤드 애벌러에 적용했을 때, 현재의 역방향 및 편집 기법(예: PTI, HyperStyle)의 한계는 무엇인가?
  • RQ4텍스트 기반 3D 생성 모델은 기하학적 사전 지식을 함께 사용할 경우에만 텍스트 프롬프트로 현실적인 인간 헤드를 생성할 수 있는가?
  • RQ5다양한 다중모달 사전 지식(예: 스캔, 오디오, 랜드마크)은 생성된 헤드 애벌러의 품질과 일관성에 어떤 영향을 미치는가?

주요 결과

  • PTI 및 HyperStyle와 같은 최신 기술 기반 방법은 강력한 역방향 성능를 보이지만, 특히 복잡한 조건에서 후행 편집 과제에서는 일반화 능력이 떨어진다.
  • TEXTure는 Latent-NeRF 및 Dream Fields보다 텍스트 기반 3D 헤드 생성에서 더 현실적이고 세밀한 결과를 내보내며, 깊이-이미지 디퓨전 및 메시 기반 텍스처 매핑 덕분이다.
  • Latent-NeRF는 기하학적 사전 지식과 텍스트 가이던스를 사용함에도 불구하고 세밀한 텍스처 생성에 어려움을 겪어, 텍스트 프롬프트를 신경 암시적 필드에 통합하는 데에 한계가 있음을 시사한다.
  • Dream Fields는 단지 텍스트 프롬프트로만 3D 헤드 모델을 완전히 생성하지 못해 인간 헤드 기하학의 복잡성에 일반화하는 데에 한계를 드러낸다.
  • 벤치마크 결과, 현재 모델들이 메이크업, 액세서리, 비중립 표정과 같은 다양한 특성에 대해 견고성이 떨어지며, 향후 연구에서 일반화 능력과 데이터 효율성 향상의 필요성을 드러낸다.
  • RenderMe-360는 다수의 과제와 특성에 걸쳐 헤드 애벌러 모델을 처음으로 종합적으로 평가할 수 있도록 하여 현실성, 다양성, 편집 가능성 측면에서 현재 모델의 핵심 격차를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.