Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Regress 3D Face Shape and Expression from an Image without 3D Supervision

Soubhik Sanyal, Timo Bolkart|arXiv (Cornell University)|2019. 05. 16.
Face recognition and analysis참고 문헌 41인용 수 6
한 줄 요약

RingNet은 동일한 사람의 여러 이미지를 활용하여 3D 얼굴 형태와 표정을 단일 이미지에서 3D 레이블 없이 회귀하는 방법을 학습한다. 이는 고리 기반의 대비 손실을 통해 형태의 불변성을 강제함으로써 달성된다. 이는 2D 얼굴 키포인트 검출과 FLAME 3D 얼굴 모델만을 사용하여, 3D 레이블이 있는 방법보다도 더 높은 정확도를 달성한다.

ABSTRACT

The estimation of 3D face shape from a single image must be robust to variations in lighting, head pose, expression, facial hair, makeup, and occlusions. Robustness requires a large training set of in-the-wild images, which by construction, lack ground truth 3D shape. To train a network without any 2D-to-3D supervision, we present RingNet, which learns to compute 3D face shape from a single image. Our key observation is that an individual's face shape is constant across images, regardless of expression, pose, lighting, etc. RingNet leverages multiple images of a person and automatically detected 2D face features. It uses a novel loss that encourages the face shape to be similar when the identity is the same and different for different people. We achieve invariance to expression by representing the face using the FLAME model. Once trained, our method takes a single image and outputs the parameters of FLAME, which can be readily animated. Additionally we create a new database of faces `not quite in-the-wild' (NoW) with 3D head scans and high-resolution images of the subjects in a wide variety of conditions. We evaluate publicly available methods and find that RingNet is more accurate than methods that use 3D supervision. The dataset, model, and results are available for research purposes at http://ringnet.is.tuebingen.mpg.de.

연구 동기 및 목표

  • 다양한 조명, 자세, 가림 등 제약 조건이 있는 환경에서 단일 이미지에서 정확한 3D 얼굴 형태와 표정을 추정하기 위해.
  • 쌍체 3D 레이블 데이터가 없는 상태에서 2D에서 3D 얼굴 형태 회귀를 위한 딥 네트워크를 훈련하기 위해, 실제 3D 레이블이 있는 이미지의 부족을 극복하기 위해.
  • 표현, 자세, 외관이 변하더라도 동일한 사람의 여러 이미지 간의 신원 일관성을 활용하여 형태의 불변성을 학습하기 위해.
  • 엄격한 평가를 위한 고해상도 3D 스캔과 다양한 촬영 조건을 갖춘 새로운 벤치마크 데이터셋 NoW를 개발하기 위해.
  • 기하학적 일관성을 활용한 자기지도 학습이 3D 레이블에 의존하는 방법보다 우수한 성능을 내는지 입증하기 위해.

제안 방법

  • RingNet은 동일한 신원의 다수의 이미지로 이루어진 고리를 사용하여, 예측된 3D 얼굴 형태가 시야 간 일관성을 유지하도록 하되, 자세와 표정은 다양하게 허용한다.
  • 동일한 신원의 이미지 간 형태 차이를 최소화하고, 다른 신원 간의 차이를 최대화하는 새로운 고리 기반 대비 손실을 적용한다.
  • FLAME 3D 얼굴 모델의 파라미터로 직접 회귀하여 형태, 자세, 표정을 분리된 방식으로 학습할 수 있도록 한다.
  • OpenPose를 사용하여 2D 얼굴 키포인트 검출을 수행하고, FLAME 모델을 사용하여 이를 3D로 투영하여 2D-3D 특징 손실을 계산한다.
  • 훈련 목표는 2D-3D 키포인트 재투영 손실과 고리의 이미지 간 형태 일관성 손실을 결합하여 기하학적 정확도를 향상시킨다.
  • 이 방법은 일반화 가능하며, 2D 관절 검출을 기반으로 한 전체 신체 3D 재구성으로도 확장 가능하다.

실험 결과

연구 질문

  • RQ13D 레이블 없이 단일 이미지에서 3D 얼굴 형태를 정확하게 회귀시킬 수 있는가?
  • RQ2동일한 사람의 여러 이미지 간의 신원 일관성을 활용하여, 쌍체 3D 데이터가 없는 상태에서 3D 회귀 네트워크를 훈련시킬 수 있는가?
  • RQ3고리 기반 대비 손실이 2D 이미지에서 3D 기하학을 학습하는 데 있어 표준 트리플릿 손실보다 우수한가?
  • RQ4실제 환경 조건에서 자기지도 학습 방법이 3D 레이블에 의존하는 방법보다 성능이 뛰어나게 될 수 있는가?
  • RQ5NoW 데이터셋이 기존 벤치마크에 비해 3D 얼굴 재구성 방법의 평가에 얼마나 기여하는가?

주요 결과

  • NoW 데이터셋 얼굴 챌린지에서 RingNet은 평균 재구성 오차 1.23 mm를 기록하여, 3D 레이블이 있는 방법인 FLAME-neutral(1.34 mm) 및 [34](1.83 mm)를 능가한다.
  • 실외 환경 이미지에서 최신 기술 수준의 성능을 달성하여, 표정, 자세, 조명, 가림, 얼굴 털 등 다양한 요소에 대해 강건함을 입증했다.
  • 절단 분석 결과에서 고리 크기를 3개에서 6개로 늘일 경우 재구성 오차가 1.25 mm에서 1.19 mm로 감소하여 기하학적 학습 향상이 확인되었다.
  • 고리 기반 손실은 트리플릿 단독 또는 단일 이미지 기반 기준선 대비 형태 일관성과 3D 정확도를 크게 향상시켰다.
  • 3D 레이블이 전혀 없는 상태에서도 3D 데이터로 훈련된 방법을 능가함으로써, 자기지도 학습을 통한 형태의 불변성은 강력한 인덕티브 바이어스임을 시사한다.
  • NoW 데이터셋은 100명의 주제에 대해 고해상도 3D 헤드 스캔과 다양한 조건의 이미지를 제공하여 도전적인 조건에서의 엄격한 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.