[논문 리뷰] High-Fidelity 3D Digital Human Creation from RGB-D Selfies
이 논문은 소비자용 RGB-D 속도 영상에서 30초 이내로 고해상도, 사진처럼 사실적인 3D 디지털 인간을 완전 자동으로 생성하는 시스템을 제안한다. 더 나아가 표현 능력이 향상된 유연한 렌더러 기반 3DMM 피팅 방법과 하이브리드 CNN-파라미터 기반 반사율 합성 방법을 도입하여 최신 기술 수준의 얼굴 기하학적 구조와 세부 묘사 정확도를 달성한다.
We present a fully automatic system that can produce high-fidelity, photo-realistic 3D digital human characters with a consumer RGB-D selfie camera. The system only needs the user to take a short selfie RGB-D video while rotating his/her head, and can produce a high quality reconstruction in less than 30 seconds. Our main contribution is a new facial geometry modeling and reflectance synthesis procedure that significantly improves the state-of-the-art. Specifically, given the input video a two-stage frame selection algorithm is first employed to select a few high-quality frames for reconstruction. A novel, differentiable renderer based 3D Morphable Model (3DMM) fitting method is then applied to recover facial geometries from multiview RGB-D data, which takes advantages of extensive data generation and perturbation. Our 3DMM has much larger expressive capacities than conventional 3DMM, allowing us to recover more accurate facial geometry using merely linear bases. For reflectance synthesis, we present a hybrid approach that combines parametric fitting and CNNs to synthesize high-resolution albedo/normal maps with realistic hair/pore/wrinkle details. Results show that our system can produce faithful 3D characters with extremely realistic details. Code and the constructed 3DMM is publicly available.
연구 동기 및 목표
- 소비자용 RGB-D 속도 영상에서 완전 자동으로 고해상도 3D 디지털 인간 재구성 기능을 제공하는 것.
- 제한된 입력 데이터로도 땀샘, 주름, 머리카락과 같은 미세한 얼굴 세부 묶음을 캡처하는 도전 과제를 해결하는 것.
- 더 표현력이 풍부한 유연한 피팅 프레임워크를 사용해 기존 3DMM을 초월한 정확도를 갖춘 얼굴 기하학적 정확도를 향상시키는 것.
- 하이브리드 파라미터 기반 및 딥 러닝 기반 접근법을 통해 고해상도 알베도 및 노멀 맵을 현실감 있게 세부 묶음을 포함하여 합성하는 것.
- 최소한의 사용자 입력으로 실시간으로 작동하며 사진처럼 사실적인 결과를 내는 시스템을 제공하는 것.
제안 방법
- 입력 RGB-D 영상에서 고품질 프레임을 식별하기 위한 이중 단계 프레임 선택 알고리즘을 사용한다.
- 다중 시점 RGB-D 데이터에서 세밀한 얼굴 기하학을 복원하기 위해 새로운 유연한 렌더러 기반 3D 모러포블 모델(3DMM) 피팅 방법을 사용한다.
- 제안된 3DMM은 기존 3DMM보다 훨씬 큰 표현 능력을 지닌 선형 기저를 사용하여 복잡한 최적화 없이도 정확한 기하학적 복원이 가능하다.
- 하이브리드 반사율 합성 파이프라인은 파라미터 피팅과 컨volution 신경망(CNN)을 조합하여 고해상도 알베도 및 노멀 맵을 생성한다.
- 3DMM 피팅 동안 광범위한 데이터 생성 및 변형을 활용하여 정확도와 세부 묶음의 정확도를 향상시킨다.
- 전체 파이프라인이 엔드 투 엔드로 훈련 가능하며, 소비자 하드웨어에서 30초 이내로 실행된다.
실험 결과
연구 질문
- RQ1완전 자동 시스템이 단일 소비자용 RGB-D 속도 영상에서 고해상도 3D 인간 재구성에 성공할 수 있는가?
- RQ2선형 기저만을 사용하는 3DMM을 통해 얼굴 기하학을 어떻게 더 정확하게 복원할 수 있는가?
- RQ3하이브리드 파라미터 기반 및 CNN 기반 방법이 땀샘과 주름과 같은 세부 묶음을 포함해 알베도 및 노멀 맵의 현실감을 어느 정도 향상시킬 수 있는가?
- RQ4다중 시점 RGB-D 데이터에 적용했을 때, 유연한 렌더링이 3DMM 피팅 성능을 향상시킬 수 있는가?
- RQ5최적화된 프레임 선택과 고급 기하학 및 반사율 모델링을 조합했을 때, 도달 가능한 재구성 품질과 속도는 어느 정도인가?
주요 결과
- 시스템은 단일 RGB-D 속도 영상에서 30초 이내로 고품질 3D 디지털 인간 캐릭터를 생성한다.
- 제안된 유연한 렌더러 기반 3DMM 피팅 방법은 이전 최신 기술 수준의 방법들보다 뛰어난 얼굴 기하학 정확도를 달성한다.
- 더 큰 표현 능력을 지닌 향상된 3DMM은 선형 기저만으로도 정확한 기하학 복원이 가능하게 하여 최적화 과정을 단순화한다.
- 하이브리드 반사율 합성 방법은 고해상도 알베도 및 노멀 맵에서 현실감 있는 머리카락, 땀샘, 주름 묶음을 성공적으로 캡처한다.
- 시스템은 세밀한 얼굴 묶음에서 뛰어난 성능을 보이며, 최소한의 사용자 입력으로 사진처럼 사실적인 결과를 달성한다.
- 코드와 제작된 3DMM이 공개되어 더 넓은 연구 및 응용 재사용을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.