Skip to main content
QUICK REVIEW

[논문 리뷰] A high fidelity synthetic face framework for computer vision

Tadas Baltrušaitis, Erroll Wood|arXiv (Cornell University)|2020. 07. 16.
Face recognition and analysis참고 문헌 11인용 수 4
한 줄 요약

이 논문은 컴퓨터 시각을 위한 고해상도 합성 얼굴 프레임워크를 제안하며, 매개변수화된 3D 얼굴 모델, 학습된 신원 및 표정 블렌드셰이프, 수작업으로 제작된 헤어 자산, 그리고 이미지 기반 조명을 사용하여 다양한, 사진처럼 사실적인 얼굴 이미지를 정확한 지표(annotation)와 함께 생성한다. 이 프레임워크는 형태, 텍스처, 표정, 자세, 조명, 헤어 등에 대해 예측할 수 없을 정도로 높은 제어력을 제공하며, 확장 가능하고 일관되며 정확한 데이터 합성 기반으로 시각 모델을 훈련시킬 수 있다.

ABSTRACT

Analysis of faces is one of the core applications of computer vision, with tasks ranging from landmark alignment, head pose estimation, expression recognition, and face recognition among others. However, building reliable methods requires time-consuming data collection and often even more time-consuming manual annotation, which can be unreliable. In our work we propose synthesizing such facial data, including ground truth annotations that would be almost impossible to acquire through manual annotation at the consistency and scale possible through use of synthetic data. We use a parametric face model together with hand crafted assets which enable us to generate training data with unprecedented quality and diversity (varying shape, texture, expression, pose, lighting, and hair).

연구 동기 및 목표

  • 컴퓨터 시각 작업을 위한 대규모로 정확하게 애너테이션된 실제 얼굴 데이터를 수집하는 데 도전하는 문제를 해결하기 위해.
  • 스케일에 따라 수동으로 확보하기 어려운 또는 불가능한 지표가 포함된 합성 얼굴 데이터를 생성하기 위해.
  • 신원, 표정, 자세, 조명, 텍스처, 헤어를 포함한 다양한 요소를 고려한 고해상도, 다양성 있고 제어 가능한 데이터 합성 기능을 제공하기 위해.
  • 실제적이며 일관되고 완전히 감독된 합성 얼굴 데이터를 기반으로 기계 학습 훈련을 지원하기 위해.
  • 기하학적 및 외관 요소에 대해 정밀한 제어를 제공하는 다양한 얼굴 이미지를 생성하는 확장 가능한 파이프라인을 제공하기 위해.

제안 방법

  • 프레임워크는 7127개의 정점과 6908개의 퀼러드 면을 가진 매개변수화된 3D 얼굴 모델을 사용하며, 블렌드셰이프와 선형 블렌드 스카잉을 통해 신원, 표정, 자세를 매개변수화한다.
  • 신원 및 표정 블렌드셰이프는 101개의 고품질 3D 스캔에서 학습되며, 기하학적 손실과 정규화 손실을 최소화하기 위해 모델 매개변수와 블렌드셰이프를 함께 최적화하는 방식으로 학습된다.
  • 텍스처는 50차원 잠재 공간을 가진 VAE로 표현되며, 잘라낸 얼굴 영역을 기반으로 인식적 손실과 MSE 손실을 사용해 훈련되어, 분리 가능하고 압축된 표현을 가능하게 한다.
  • 헤어는 물리 기반 쉐이더를 사용한 3D 실로 모델링되며, 136개의 두피, 50개의 눈썹, 71개의 수염, 3개의 속눈썹 스타일이 있으며, 각각 멜라닌과 회색 비율을 통해 색상이 할당된다.
  • 헤어는 길이, 밀도, 유동 방향을 위한 볼륨 맵을 포함한 UV 매핑을 사용해 인코딩되며, ML 호환성을 위해 주성분 분석(PCA) 기반 차원 축소가 가능하다.
  • 조명은 324개의 HDR 환경 맵을 사용해 시뮬레이션되며, log(1+I)로 사전 처리되고, 주성분 분석(PCA)을 통해 50차원으로 압축되어 분산의 80%를 포괄한다. 각 이미지에 대해 5개의 랜덤 회전을 적용해 데이터 증강을 수행한다.

실험 결과

연구 질문

  • RQ1합성 얼굴 생성 파이프라인은 컴퓨터 시각 작업을 위한 정확하고 일관되며 완전히 감독된 애너테이션을 가진 사진처럼 사실적인 이미지를 생성할 수 있는가?
  • RQ23D 얼굴 모델은 기하학적 정확도를 유지하면서 기형을 방지하고, 동시에 신원과 표정 블렌드셰이프를 공동으로 최적화하여 학습할 수 있는가?
  • RQ3VAE 기반 텍스처 표현은 기계 학습을 위해 압축되고 분리 가능한 잠재 표현을 제공하면서도 얼굴 세부 정보를 얼마나 잘 유지할 수 있는가?
  • RQ43D 헤어 실은 다양한 조건의 조명과 얼굴 기하학적 형태에서 다양하고 현실적이며 학습 가능한 헤어 스타일을 지원하기 위해 어떻게 모델링하고 매개변수화할 수 있는가?
  • RQ5PCA로 압축된 HDR 맵을 사용한 이미지 기반 조명은 효율적인 데이터 증강을 가능하게 하면서도 다양한 현실적인 조명 조건을 효과적으로 시뮬레이션할 수 있는가?

주요 결과

  • 단일 렌더링 파이프라인을 사용하여 1024×1024 해상도의 사진처럼 사실적인 얼굴 이미지를 생성하며, 이는 신원, 표정, 자세, 조명, 텍스처, 헤어 등에서 매우 높은 다양성을 보인다.
  • 모델 매개변수와 신원 블렌드셰이프의 공동 최적화를 통해 높은 기하학적 정확도를 달성하여 정점 및 법선 위치의 오차를 최소화하고 해부학적 타당성과 메쉬 품질을 강제한다.
  • VAE 기반 텍스처 표현은 인식적 품질을 유지하면서도 효과적인 다양한 얼굴 텍스처 생성이 가능한 압축된 50차원의 잠재 공간을 달성한다.
  • UV 및 볼륨 맵을 사용한 헤어 표현은 PCA 기반 차원 축소를 통해 복잡한 헤어 스타일을 정확하게 재구성할 수 있으며, 효율적인 기계 학습 활용을 지원한다.
  • PCA로 압축된 HDR 조명 모델은 단지 50차원으로도 분산의 80%를 포괄하며, 1620개의 증강된 조명 조건에서 효율적이고 현실적인 조명 변화를 가능하게 한다.
  • 전체 파이프라인이 형태, 자세, 표정, 외관에 대한 지표가 포함된 합성 데이터를 생성하여 수동 레이블링 없이도 신뢰할 수 있는 컴퓨터 시각 모델 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.