Skip to main content
QUICK REVIEW

[논문 리뷰] CNN-based Real-time Dense Face Reconstruction with Inverse-rendered Photo-realistic Face Images

Yudong Guo, Juyong Zhang|arXiv (Cornell University)|2017. 08. 03.
Face recognition and analysis참고 문헌 48인용 수 5
한 줄 요약

이 논문은 역렌더링과 다중 척도 세부 정보 전달을 통해 생성된 새로운 사진 수준의 데이터셋을 사용하여 실시간, CNN 기반의 고밀도 3D 얼굴 재구성 프레임워크를 제안한다. 대규모이고 다양한 훈련 데이터를 기반으로 코arse-to-fine 네트워크 아키텍처를 훈련시킴으로써, 계산량을 줄이고도 높은 정밀도의 재구성을 달성하며, 자세, 표정, 조명 변화에 대해 강건함을 유지하면서도 기하학적 정확도와 세부 정보 유지 측면에서 최신 기술을 능가한다.

ABSTRACT

With the powerfulness of convolution neural networks (CNN), CNN based face reconstruction has recently shown promising performance in reconstructing detailed face shape from 2D face images. The success of CNN-based methods relies on a large number of labeled data. The state-of-the-art synthesizes such data using a coarse morphable face model, which however has difficulty to generate detailed photo-realistic images of faces (with wrinkles). This paper presents a novel face data generation method. Specifically, we render a large number of photo-realistic face images with different attributes based on inverse rendering. Furthermore, we construct a fine-detailed face image dataset by transferring different scales of details from one image to another. We also construct a large number of video-type adjacent frame pairs by simulating the distribution of real video data. With these nicely constructed datasets, we propose a coarse-to-fine learning framework consisting of three convolutional networks. The networks are trained for real-time detailed 3D face reconstruction from monocular video as well as from a single image. Extensive experimental results demonstrate that our framework can produce high-quality reconstruction but with much less computation time compared to the state-of-the-art. Moreover, our method is robust to pose, expression and lighting due to the diversity of data.

연구 동기 및 목표

  • 딥 러닝 모델 훈련을 위한 대규모, 사진 수준의 3D 얼굴 데이터셋이 부족한 문제를 해결하기 위해.
  • 단일 영상 또는 단일 이미지에서 딥 러닝을 이용해 실시간으로 고품질의 고밀도 3D 얼굴 재구성을 가능하게 하기 위해.
  • 기존의 CNN 기반 방법이 합성된, 비사진 수준의 데이터 또는 정확도가 제한된 비지도 손실 함수에 의존하는 한계를 극복하기 위해.
  • 역렌더링과 세부 정보 전달을 통해 다양한 자세, 표정, 조명 조건을 가진 다채로운 실제적인 얼굴 이미지를 생성하는 훈련 데이터 파이프라인을 개발하기 위해.
  • 실시간으로 기하학, 알베도, 조명, 자세를 동시에 추정할 수 있는 코어스-투-파인 네트워크 아키텍처를 구축하기 위해.

제안 방법

  • 실제 사진에서 시작하여 다양한 자세, 표정, 조명 파rameter를 조작함으로써 최적화 기반의 역렌더링 과정을 통해 대규모 사진 수준의 얼굴 이미지를 생성한다.
  • 고해상도 원본 이미지에서 대상 이미지로 다중 척도 얼굴 세부 정보(예: 주름)를 전달하는 새로운 세부 정보 전달 기법을 제안하여 세밀한 해상도의 3D 얼굴 모델 생성을 가능하게 한다.
  • 훈련 데이터셋은 코어스 스케일 및 파인 스케일 사진 수준의 얼굴 이미지와 실제 영상의 동적 특성을 모방하는 시뮬레이션된 영상 프레임 쌍을 포함한다.
  • 단일 영상 코어스넷, 트래킹 코어스넷, 파인넷으로 구성된 3단계 CNN 프레임워크를 제안하여 단일 영상 또는 단일 영상 시퀀스에서 엔드 투 엔드로 실시간 재구성을 수행한다.
  • 훈련 안정성과 정확도 향상을 위해 ℒ_pose 및 ℒ_geo로 정의된 자세 및 기하학 재구성 오차를 조합한 손실 함수를 사용하여 표준 MSE 및 정점 거리 지표보다 우수한 성능을 달성한다.
  • 공개된 GitHub를 통해 2D 이미지, 3D 코어스 모델, 3D 파인 모델, 다중 시점 얼굴 데이터를 포함한 대규모 데이터셋을 사용하여 프레임워크를 훈련시켰다.

실험 결과

연구 질문

  • RQ1실사 사진의 역렌더링이 파arametric 모델 기반 합성보다 더 정확한 3D 얼굴 재구성을 가능하게 하는 사진 수준의 훈련 데이터를 생성할 수 있는가?
  • RQ2주름과 같은 다중 척도 얼굴 세부 정보를 이미지 간에 효과적으로 전달하여 3D 재구성의 세밀한 기하학적 구조를 향상시킬 수 있는가?
  • RQ3다양하고 현실적인 데이터를 기반으로 훈련된 코어스-투-파인 CNN 아키텍처가 실시간 성능을 유지하면서도 기하학 및 외관 재구성 정확도를 높일 수 있는가?
  • RQ4제안된 손실 함수(ℒ_pose 및 ℒ_geo)가 표준 지표인 MSE 및 정점 거리 지표에 비해 재구성 품질 향상에 얼마나 기여하는가?
  • RQ5훈련 데이터의 다양성(자세, 표정, 조명)이 영상 및 단일 이미지 입력에서의 실제 세계의 변동성에 대한 강건성 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 [42]보다 훨씬 낮은 테스트 오차를 기록하였으며, ℒ_pose는 26.35에서 7.69로 감소하고 ℒ_geo는 5.53에서 4.23으로 감소하여 훈련 수렴성과 정확도 향상을 입증하였다.
  • FRGC V2 데이터셋의 Spring2004range 서브셋에서, RMSE는 4.915 mm, MAE는 3.846 mm를 기록하여 두 지표에서 모두 [61] 및 [60]을 능가하였다.
  • 그림 16의 시각적 비교 결과, 제안된 방법은 [42], [3], [24], [46], [14]보다 더 정확한 전반적인 기하학적 구조와 더 세밀한 얼굴 세부 정보(예: 주름)를 생성하였다.
  • 실시간으로 작동하여 단일 영상 또는 단일 영상 시퀀스에서 온라인 재구성을 가능하게 하였으며, 최적화 기반 최신 기술 대비 계산 시간을 크게 단축시켰다.
  • 다양한 자세, 표정, 조명 조건을 포함한 훈련 데이터의 다양성 덕분에 자세, 표정, 조명 변화에 강건함을 보였다. 이는 다양한 파rameter와 시뮬레이션된 영상 시퀀스를 포함한 훈련 데이터 덕분이었다.
  • 2D 이미지, 3D 코어스 및 파인 모델, 다중 시점 데이터를 포함한 공개된 데이터셋은 향후 얼굴 분석, 인식 및 정규화 분야의 연구에 기여할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.