Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Facial Expression Reconstruction using Cascaded Regression

Fanzi Wu, Songnan Li|arXiv (Cornell University)|2017. 12. 10.
Face recognition and analysis참고 문헌 1인용 수 6
한 줄 요약

이 논문은 자이르, 조명, 자세 변화에 견딜 수 있는 3D 얼굴 표정 복원을 위해 랜드마크 이동(LD) 특징과 HOG를 사용한 계단식 회귀 프레임워크를 제안한다. 반복적 개선을 통해 3DMM 매개변수를 동시 회귀하고 매핑 행렬을 추정함으로써 기존 최고 수준의 방법보다 더 높은 정밀도의 3D 얼굴 형태를 구현한다.

ABSTRACT

This paper proposes a novel model fitting algorithm for 3D facial expression reconstruction from a single image. Face expression reconstruction from a single image is a challenging task in computer vision. Most state-of-the-art methods fit the input image to a 3D Morphable Model (3DMM). These methods need to solve a stochastic problem and cannot deal with expression and pose variations. To solve this problem, we adopt a 3D face expression model and use a combined feature which is robust to scale, rotation and different lighting conditions. The proposed method applies a cascaded regression framework to estimate parameters for the 3DMM. 2D landmarks are detected and used to initialize the 3D shape and mapping matrices. In each iteration, residues between the current 3DMM parameters and the ground truth are estimated and then used to update the 3D shapes. The mapping matrices are also calculated based on the updated shapes and 2D landmarks. HOG features of the local patches and displacements between 3D landmark projections and 2D landmarks are exploited. Compared with existing methods, the proposed method is robust to expression and pose changes and can reconstruct higher fidelity 3D face shape.

연구 동기 및 목표

  • 오염, 조명, 텍스처 변화로 인해 불완전한 문제로 간주되는 단일 RGB 이미지에서 3D 얼굴 표정 복원에 도전한다.
  • 반복 최적화에 의존하고 표정 및 자세 변화에 민감한 기존 3DMM 피팅 방법의 한계를 극복한다.
  • 새로운 고수준 특징인 랜드마크 이동(LD)을 도입하여 스케일, 회전, 조명 변화에 견딜 수 있는 학습 기반 방법을 개발한다.
  • 학습 기반 3D 복원 방법의 공정한 평가를 위해 3DMM 매개변수와 해당 3D 메쉬를 포함한 표준화된 3D 얼굴 데이터셋을 제공한다.
  • Bosphorus 데이터셋의 4,666장의 훈련 이미지만을 사용하여도 새로운 신원과 표정에 잘 일반화되는 정확하고 견고한 3D 얼굴 복원을 가능하게 한다.

제안 방법

  • 정확한 랜드마크 검출 알고리즘을 통해 2D 얼굴 랜드마크를 추출하여 3DMM 매개변수와 매핑 행렬을 초기화한다.
  • 지역 이미지 패치의 HOG 특징과 랜드마크 이동(LD)을 조합한 공동 특징을 도입하여 조명 및 변형 변화에 강건한 의미론적 및 기하학적 정보를 인코딩한다.
  • 잔차가 현재 3DMM 매개변수와 진짜값 사이에서 추정되고, 이를 반복적으로 활용하여 형태와 매핑 행렬을 개선하는 계단식 회귀 프레임워크를 구현한다.
  • 매핑 행렬을 직접 추정함으로써 회귀를 하지 않고, 데이터 의존도를 줄이고 일반화 능력을 향상시킨다.
  • 최적화 중에 효율적이고 일관된 3D에서 2D 매핑을 위해 정사영 투영을 사용한다.
  • Bosphorus와 FaceWarehouse에서 유래한 3DMM 매개변수와 3D 메쉬를 포함한 3D 얼굴 데이터베이스를 활용하여 훈련 및 평가를 수행함으로써 진짜값 대응을 보장한다.

실험 결과

연구 질문

  • RQ1랜드마크 이동과 HOG 특징을 사용한 계단식 회귀 프레임워크는 자세 및 표정 변화에 견딜 수 있는 3D 얼굴 표정 복원의 정교함을 향상시킬 수 있는가?
  • RQ2제안된 공동 특징(HOG + LD)은 기존 특징 대비 조명 및 기하학적 변화를 다룰 때 어떻게 성능을 발휘하는가?
  • RQ3제한된 데이터셋(4,666장)에서 훈련된 모델이 새로운 데이터셋에서 다양한 신원과 표정에 얼마나 잘 일반화되는가?
  • RQ4매핑 행렬을 직접 추정하는 것이 회귀하는 것보다 성능 향상과 데이터 의존도 감소에 기여하는가?
  • RQ5소규모 훈련 세트만을 사용하여도 제안된 방법이 최고 수준의 방법보다 더 높은 복원 정밀도를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 주요 얼굴 영역과 전체 얼굴 영역에서 Zhu 등과 다른 최고 수준의 방법보다 낮은 RMSE를 기록하며, 진짜값 메쉬에서 정확도가 향상되었다.
  • 다양한 신원과 극단적인 표정에 걸쳐 구분 가능한 3D 얼굴 형태를 복원하며, 특히 도전적인 표정에서 입술 기하학을 정확히 포착한다.
  • FRGC2 데이터셋에서의 교차 데이터셋 평가를 통해 조명 변화에 대한 견고함과 다양한 주제 및 표정 간 일관된 성능을 입증했다.
  • Bosphorus에서의 4,666장의 훈련 이미지만을 사용하여도, 훨씬 더 큰 데이터셋(114K–122K장)에서 훈련된 딥러닝 기반 기준선([23], [24])을 초월하는 성능을 달성했다.
  • 랜드마크 이동(LD) 특징은 2D 랜드마크와 3D 투영 간 의미론적 및 기하학적 관계를 인코딩함으로써 견고성을 기여한다.
  • 회귀가 아닌 직접적인 매핑 행렬 추정은 과적합을 줄이고, 특히 제한된 훈련 데이터에서 일반화 능력을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.