[논문 리뷰] FaceScape: 3D Facial Dataset and Benchmark for Single-View 3D Face Reconstruction
이 논문은 847명의 피험자에서 16,940개의 고해상도 질감이 구현된 3D 얼굴 모델을 포함하는 대규모 3D 얼굴 데이터셋 FaceScape를 소개한다. 각 피험자는 20개의 표정으로 촬영되었으며, 모낭 수준의 기하학적 구조를 구현하였다. 단일 이미지에서 조작 가능한, 표정에 특화된 3D 얼굴 모델을 예측하기 위한 이중 단계 딥러닝 방법을 제안하였으며, 정확한 동적 세부 정보 합성을 달성하고, 실외 및 실내 환경 평가를 통해 단일 시야 3D 얼굴 재구성 분야의 새로운 기준을 설정하였다.
In this paper, we present a large-scale detailed 3D face dataset, FaceScape, and the corresponding benchmark to evaluate single-view facial 3D reconstruction. By training on FaceScape data, a novel algorithm is proposed to predict elaborate riggable 3D face models from a single image input. FaceScape dataset releases $16,940$ textured 3D faces, captured from $847$ subjects and each with $20$ specific expressions. The 3D models contain the pore-level facial geometry that is also processed to be topologically uniform. These fine 3D facial models can be represented as a 3D morphable model for coarse shapes and displacement maps for detailed geometry. Taking advantage of the large-scale and high-accuracy dataset, a novel algorithm is further proposed to learn the expression-specific dynamic details using a deep neural network. The learned relationship serves as the foundation of our 3D face prediction system from a single image input. Different from most previous methods, our predicted 3D models are riggable with highly detailed geometry under different expressions. We also use FaceScape data to generate the in-the-wild and in-the-lab benchmark to evaluate recent methods of single-view face reconstruction. The accuracy is reported and analyzed on the dimensions of camera pose and focal length, which provides a faithful and comprehensive evaluation and reveals new challenges. The unprecedented dataset, benchmark, and code have been released at https://github.com/zhuhao-nju/facescape.
연구 동기 및 목표
- 단일 시야 3D 얼굴 재구성 방법의 훈련 및 평가를 위해 세밀한 기하학적 구조와 표정 변동성을 갖춘 대규모 고품질 3D 얼굴 데이터셋의 부족 문제를 해결하기 위해.
- 단일 이미지에서 표정에 따라 변화하는 동적 기하학적 구조(예: 주름)를 포괄하는 세밀하고 조작 가능한 3D 얼굴 모델을 예측하는 방법을 개발하기 위해.
- 실외 및 실내 데이터를 포함한 정확한 진짜 기하학적 구조를 갖춘, 단일 시야 3D 얼굴 재구성 방법 평가를 위한 종합적인 벤치마크를 수립하기 위해.
- 이동성 표현을 위한 이격도 맵 기반 표현 방식을 통해 표정에 특화된 동적 세부 정보를 학습시켜, 예측된 3D 얼굴의 현실감과 조작 가능성 향상시키기 위해.
- 연구를 가속화하기 위해 공개된 데이터셋과 벤치마크를 제공하여 비상업적 연구를 지원하기 위해.
제안 방법
- FaceScape 데이터셋은 68대의 고밀도 카메라 어레이를 사용하여 고해상도 3D 얼굴 스캔을 촬영하여, 모낭 수준의 기하학적 구조를 확보하고, 0.2mm 이내의 초고정밀도를 확보한다.
- 원시 스캔은 거칠은 형태를 위한 정점 일관성 있는(Uniform, TU) 모델과 세부 정보를 위한 이격도 맵으로 처리되어, 피험자 간 일관된 기하학적 구조를 보장한다.
- TU 모델을 기반으로 신체 및 표정 차원에서 이중선형 3D 형태 모형을 구축하여, 이전 방법에 비해 표현 능력을 향상시킨다.
- 이중 단계 딥러닝 파이프라인을 제안한다: 첫 번째 단계에서 2D 얼굴 특징점에 기반한 거친 메esh를 피팅하고, 두 번째 단계에서 신경망을 통해 표정에 특화된 이격도 맵을 예측한다.
- 동적 세부 정보는 학습된 이격도 맵의 선형 조합으로 모델링되어, 예측된 3D 얼굴이 미리 보지 않은 주름까지 포함해 어떤 표정으로도 조작 가능하게 한다.
- 벤치마크는 실내 및 실외 데이터를 포함하며, 실제 기하학적 구조가 0.2mm 이내로 정렬되어 있어 카메라 자세, 초점 거리, 표정 정확도 평가가 가능하다.
실험 결과
연구 질문
- RQ120개의 표정과 모낭 수준의 기하학적 구조를 갖춘 대규모 고해상도 3D 얼굴 데이터셋은 단일 시야 3D 얼굴 재구성의 정확성과 현실감을 향상시킬 수 있는가?
- RQ2딥러닝을 활용해 단일 이미지에서 주름과 같은 동적 얼굴 세부 정보를 효과적으로 모델링하고 예측할 수 있는가?
- RQ3학습된 이격도 맵 표현 방식이 다양한 표정에서 조작 가능한 3D 얼굴 모델을 얼마나 잘 지원하는가?
- RQ4정확한 진짜 기하학적 구조와 다양한 조건을 갖춘 본 논문의 벤치마크는 단일 시야 3D 얼굴 재구성 분야에 새로운 과제를 드러내는가?
- RQ5기존 방법은 측면 시야와 중간 척도 기하학적 구조를 다룰 때 어떤 한계를 보이며, 이를 어떻게 보완할 수 있는가?
주요 결과
- FaceScape는 847명의 피험자에서 16,940개의 고해상도 3D 얼굴 모델을 포함하며, 각 피험자는 20개의 표정으로 촬영되었고, 68대의 고밀도 카메라 어레이를 사용해 0.2mm 이내의 초고정밀도로 촬영되었다.
- 제안된 이중 단계 방법은 표정에 특화된 이격도 맵을 학습함으로써, 예측된 3D 얼굴 모델이 정확한 동적 세부 정보(예: 미리 보지 않은 주름)를 갖추고 조작 가능한 방식으로 성공적으로 예측하였다.
- FaceScape 기반으로 구축된 이중선형 3D 형태 모형은 이전 방법에 비해 표현 능력이 뛰어나, 신체 및 표정 간 형태 모델링 성능이 향상되었다.
- 벤치마크는 실내 및 실외 데이터에서 최근 14개의 방법을 평가하였으며, 카메라 자세, 초점 거리, 표정 정확도 등 과제를 드러내었고, 특히 제약 없는 조건에서 어려움을 보였다.
- 측면 시야 얼굴에 대해서는 성능 저하가 발생하고 중간 척도 기하학적 구조 처리에 어려움을 겪어 일반화 능력과 기하학적 정확도 향상 여지가 있음을 시사하였다.
- 데이터셋과 벤치마크는 비상업적 연구를 위해 공개되었으며, 코드와 데이터는 https://github.com/zhuhao-nju/facescape.git 에서 이용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.