Skip to main content
QUICK REVIEW

[논문 리뷰] Landmark Detection and 3D Face Reconstruction for Caricature using a Nonlinear Parametric Model

Hongrui Cai, Yudong Guo|arXiv (Cornell University)|2020. 04. 20.
Face recognition and analysis참고 문헌 57인용 수 6
한 줄 요약

이 논문은 6,000개의 레이블이 부여된 카리커처 데이터셋을 기반으로 훈련된 딥 뉴럴 네트워크를 사용하여 단일 2D 카리커처 이미지에서 끝내기로 2D 지점 검출 및 3D 얼굴 재구성에 대한 처음으로 종단 간(end-to-end) 방법을 제안한다. 비선형 파arametric 3D 카리커처 모델을 도입하여 3D 형태와 방향을 회귀함으로써, 수동으로 지정된 지점 입력 없이도 최신 기술 수준의 정확도와 실시간 추론(1초당 10ms)을 달성하였다. 이는 기존 방법보다 속도와 지점 정밀도 면에서 뛰어나다.

ABSTRACT

Caricature is an artistic abstraction of the human face by distorting or exaggerating certain facial features, while still retains a likeness with the given face. Due to the large diversity of geometric and texture variations, automatic landmark detection and 3D face reconstruction for caricature is a challenging problem and has rarely been studied before. In this paper, we propose the first automatic method for this task by a novel 3D approach. To this end, we first build a dataset with various styles of 2D caricatures and their corresponding 3D shapes, and then build a parametric model on vertex based deformation space for 3D caricature face. Based on the constructed dataset and the nonlinear parametric model, we propose a neural network based method to regress the 3D face shape and orientation from the input 2D caricature image. Ablation studies and comparison with state-of-the-art methods demonstrate the effectiveness of our algorithm design. Extensive experimental results demonstrate that our method works well for various caricatures. Our constructed dataset, source code and trained model are available at https://github.com/Juyong/CaricatureFace.

연구 동기 및 목표

  • 극도로 비례가 왜곡된 기하학적 특징과 예술적 다양성으로 인해 기존 자동 2D 지점 검출 및 3D 얼굴 재구성 방법이 부족한 문제를 해결하기 위해.
  • 표준 3D 모러포틱 모델(3DMM)이 과도하게 과장된 카리커처 형태에 일반화되지 못하는 한계를 극복하기 위해.
  • 카리커처 얼굴의 고유한 변형 패턴을 포괄하는 데이터 기반 비선형 파arametric 모델을 개발하기 위해.
  • 2D 카리커처 이미지에서 직접 3D 형태와 방향을 회귀하는 종단 간 딥 러닝 프레임워크를 설계하여, 3D 투영을 통한 자동 지점 예측을 가능하게 하기 위해.
  • 학습 및 벤치마킹을 위해 사용할 수 있는 2D 카리커처, 해당 3D 형태 및 68점 지점 레이블을 포함한 대규모이고 다양한 데이터셋을 구축하기 위해.

제안 방법

  • 저자는 약 6,000개의 2D 카리커처 이미지에 수동으로 레이블링된 68개의 지점을 포함하고, 스타일 전이 기법을 통해 약 2,000개의 자동 생성된 카리커처 이미지와 해당 3D 형태를 포함하는 데이터셋을 구축하였다.
  • 표준 3DMM 또는 FaceWarehouse 모델이 다룰 수 없는 범위를 초월하는 과장된 얼굴 형태를 표현하기 위해, 3D 카리커처 데이터셋에서 정점 기반 변형 공간에 비선형 파arametric 모델을 학습하였다.
  • 입력 2D 카리커처 이미지의 특징을 추출하기 위해 ResNet-34 백본을 인코더로 사용하고, 이후 변형 파arameter와 얼굴 방향을 회귀하기 위한 디코더 헤드를 적용하였다.
  • 직접 정점 좌표를 예측하는 대신, 평균 형태에 대한 변형 계수의 형태로 3D 얼굴 형태를 예측함으로써, 극단적인 과장에 대한 일반화 능력을 향상시켰다.
  • 예측된 3D 지점(68점)을 추정된 카메라 방향을 사용하여 이미지 평면에 투영함으로써 2D 지점을 복원하였다.
  • 이 방법은 완전히 종단 간(end-to-end)이며, 기존 최적화 기반 접근 방식과 달리 추론 시 진짜 2D 지점 레이블이 필요로 하지 않는다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크는 단일 2D 카리커처 이미지에서 3D 카리커처 형태와 방향을 직접 예측할 수 있는가? 이는 자동 지점 검출을 가능하게 한다.
  • RQ2표준 3D 얼굴 모델의 외삽 한계를 초월하여, 카리커처 얼굴의 극도로 비선형적인 기하학적 왜곡을 표현할 수 있는 비선형 파arametric 모델은 어떻게 구성할 수 있는가?
  • RQ32D 지점 검출을 직접 예측하는 대신 3D 형태와 방향을 회귀하는 것이, 극도로 스타일화되고 과장된 카리커처에서 더 강력하고 정확한 지점 검출을 가능하게 하는가?
  • RQ4제안된 방법은 예술가별 맞춤 조정이나 정규-카리커처 쌍 데이터가 없이도 다양한 예술 스타일에 일반화될 수 있는가?
  • RQ5기존 최신 기술 수준의 방법들에 비해, 수동으로 지정된 지점 레이블을 입력으로 요구하는 방법들과 비교했을 때 정확도와 속도 면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 예측된 2D 지점과 진짜 지점 간 평균 제곱 오차(MSE)가 4.98로, 추론 시 진짜 지점 레이블을 사용하지 않았음에도 불구하고 3DMM(6.32) 및 FaceWarehouse(7.61)를 능가하였다.
  • 이 방법은 약 10ms의 추론 시간을 기록하여 실시간 성능을 달성하였으며, 수동 지점 입력이 필요한 최신 기술 수준의 방법[12]의 12.5초 대비 빠른 성능을 보였다.
  • 정성적 결과에서는 다양한 예술 스타일과 과장 수준에서도 재구성된 3D 메esh가 자연스럽고 생생하며 입력 카리커처와 잘 정렬되어 있음을 확인하였다.
  • 제거 실험(Ablation studies) 결과, 비선형 파arametric 모델과 3D 형태 + 방향 회귀 파이프라인은 성능 향상에 필수적이며, 구성 요소를 제거할 경우 정확도가 크게 떨어졌다.
  • 저자는 정규-카리커처 쌍 데이터에 의존하지 않고 다양한 예술가와 스타일에 대해 잘 일반화됨을 확인하였으며, 이는 다양성이 높은 데이터셋으로 훈련되었기 때문이다.
  • 저자는 GitHub에 데이터셋, 코드, 훈련된 모델을 공개하여 재현 가능성과 향후 벤치마킹을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.