Skip to main content
QUICK REVIEW

[논문 리뷰] High-Fidelity 3D Digital Human Head Creation from RGB-D Selfies

Linchao Bao, Xiangkai Lin|arXiv (Cornell University)|2020. 10. 12.
Face recognition and analysis인용 수 11
한 줄 요약

이 논문은 소비자용 RGB-D 속도 영상에서 30초 이내로 고해상도, 사진처럼 사실적인 3D 디지털 인간 헤드를 완전 자동으로 생성하는 시스템을 제시한다. 이는 차별 가능한 렌더러 기반 3D 모러포블 모델(3DMM)과 매개변수 적합 및 CNN을 결합한 하이브리드 반사율 합성 방법을 통합하여, 실제 모낭, 주름, 머리카락 등의 세부 사항을 포함한 세밀한 얼굴 기하학과 고해상도 알베도/노멀 맵을 구현한다.

ABSTRACT

We present a fully automatic system that can produce high-fidelity, photo-realistic 3D digital human heads with a consumer RGB-D selfie camera. The system only needs the user to take a short selfie RGB-D video while rotating his/her head, and can produce a high quality head reconstruction in less than 30 seconds. Our main contribution is a new facial geometry modeling and reflectance synthesis procedure that significantly improves the state-of-the-art. Specifically, given the input video a two-stage frame selection procedure is first employed to select a few high-quality frames for reconstruction. Then a differentiable renderer based 3D Morphable Model (3DMM) fitting algorithm is applied to recover facial geometries from multiview RGB-D data, which takes advantages of a powerful 3DMM basis constructed with extensive data generation and perturbation. Our 3DMM has much larger expressive capacities than conventional 3DMM, allowing us to recover more accurate facial geometry using merely linear basis. For reflectance synthesis, we present a hybrid approach that combines parametric fitting and CNNs to synthesize high-resolution albedo/normal maps with realistic hair/pore/wrinkle details. Results show that our system can produce faithful 3D digital human faces with extremely realistic details. The main code and the newly constructed 3DMM basis is publicly available.

연구 동기 및 목표

  • 소비자용 RGB-D 카메라만을 사용하여 고해상도, 실시간 3D 디지털 인간 헤드 생성을 가능하게 하기.
  • 최소한의 사용자 입력으로 다중 시점 RGB-D 데이터로부터 정확한 얼굴 기하학 복원에 도전하기.
  • 모낭, 주름, 눈썹 털과 같은 세부 사항을 포함한 고해상도, 현실적인 알베도 및 노멀 맵을 합성하기.
  • 최소한의 사용자 상호작용으로 레이어링 가능하고 애니메이션 준비가 된 3D 아바타를 생성하는 완전 자동 파이프라인 개발하기.

제안 방법

  • 단일 속보에서 고품질 RGB-D 프레임을 선별하기 위한 이중 단계 프레임 선택 절차를 통해 복원을 위한 데이터를 확보한다.
  • 새로가 구축된 고도로 표현력이 풍부한 3DMM을 사용하여, 다중 해상도 피라미드 기반의 매개변수 적합 기법을 적용한 차별 가능한 렌더러 기반 3DMM 피팅 알고리즘을 통해 얼굴 기하학을 복원한다.
  • 텍스처 공간을 줄이고 기하학적 제약 강화를 향상시키기 위해 GAN 대신 PCA 기반 텍스처 기저를 사용한다.
  • 하이브리드 반사율 합성 파이프라인은 먼저 알베도 및 노멀 맵에 대해 다중 해상도 피라미드 기반의 지역적 매개변수 적합을 적용한다.
  • 그 후 CNN 기반의 정밀화 네트워크가 초기 맵을 향상시켜 고해상도(2048×2048) 결과를 생성하며, 실제적인 세부 사항을 구현한다.
  • 시스템은 자동으로 헤드 모델을 완성하고, 머리카락 모델을 매칭하며, 눈구멍/이빨 위치를 추정하고, 레이어링를 위한 표정 블렌드셰이프를 생성한다.

실험 결과

연구 질문

  • RQ1완전 자동 시스템이 소비자용 RGB-D 속보에서 30초 이내로 고해상도 3D 인간 헤드를 생성할 수 있는가?
  • RQ2다중 시점 RGB-D 데이터는 단일 영상 또는 다중 시점 RGB 방법을 초월하여 얼굴 기하학 복원을 어떻게 향상시킬 수 있는가?
  • RQ3표현력이 향상된 선형 기저 성분만을 사용하는 차별 가능한 3DMM이 정확한 얼굴 기하학을 복원할 수 있는가?
  • RQ4하이브리드 매개변수 기반 및 딥러닝 기반 접근법이 모낭, 주름과 같은 실제적인 얼굴 세부 사항을 포함한 고해상도 알베도 및 노멀 맵을 합성할 수 있는가?
  • RQ5이 시스템은 훈련 데이터에 포함되지 않은 인종(예: 동아시아계 외) 또는 콧수염, 잔주름, 피임점이 있는 사람에게까지 얼마나 일반화되는가?

주요 결과

  • 단일 RGB-D 속보 영상에서 30초 이내로 현실적인 기하학과 사진처럼 사실적인 텍스처를 구비한 고품질 3D 디지털 인간 헤드를 생성한다.
  • 광범위한 데이터 생성 및 변형을 통해 구축된 제안된 3DMM은 선형 기저 성분만을 사용하여도 정확한 얼굴 기하학 복원이 가능하다.
  • 고해상도(2048×2048) 알베도 및 노멀 맵이 성공적으로 합성되었으며, 눈썹 털, 입 주름, 피부 모낭 등의 명확한 세부 사항이 확인된다.
  • 반사율 합성 파이프라인은 매개변수 적합과 CNN 정밀화를 조합하여 기존 방법에 비해 세부 사항의 정확도를 크게 향상시켰다.
  • 다양한 조명 조건과 자세에서도 결과가 일관되게 유지되지만, 조명과 알베도 간의 본질적 모호성으로 인해 피부 톤 변형은 제한된다.
  • 완성된 헤드 모델, 매칭된 머리카락, 표정 블렌드셰이프를 포함한 레이어링 가능한 3D 아바타를 생성하여 실시간 애니메이션 및 립싱크 응용이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.