[논문 리뷰] Joint Face Detection and Facial Motion Retargeting for Multiple Faces
이 논문은 실시간 얼굴 동작 리타겟팅을 위한 단일 엔드 투 엔드 딥 러닝 네트워크를 제안하며, 다중 얼굴을 동시에 검출하고 3D 모형화 모델(3DMM) 파라미터를 회귀한다. 단일 얼굴 데이터로 훈련된 분리된 다중 스케일 아키텍처를 활용하고, 다중 얼굴 이미지에 약한 지도 학습 기반의 3DMM 진짜값을 전이함으로써, 높은 검출 정확도(mAP 98.8%)와 극단적인 자세 및 표정에 대한 강건성을 확보하였으며, 속도와 메모리 효율성 면에서 캐스케이드 방법을 능가한다.
Facial motion retargeting is an important problem in both computer graphics and vision, which involves capturing the performance of a human face and transferring it to another 3D character. Learning 3D morphable model (3DMM) parameters from 2D face images using convolutional neural networks is common in 2D face alignment, 3D face reconstruction etc. However, existing methods either require an additional face detection step before retargeting or use a cascade of separate networks to perform detection followed by retargeting in a sequence. In this paper, we present a single end-to-end network to jointly predict the bounding box locations and 3DMM parameters for multiple faces. First, we design a novel multitask learning framework that learns a disentangled representation of 3DMM parameters for a single face. Then, we leverage the trained single face model to generate ground truth 3DMM parameters for multiple faces to train another network that performs joint face detection and motion retargeting for images with multiple faces. Experimental results show that our joint detection and retargeting network has high face detection accuracy and is robust to extreme expressions and poses while being faster than state-of-the-art methods.
연구 동기 및 목표
- 얼굴 동작 리타겟팅을 위해 별도로 얼굴 검출과 3DMM 피팅을 수행하는 캐스케이드 방법의 비효율성과 지연 문제를 해결한다.
- 다중 얼굴 데이터셋에서 3DMM 파라미터 애너테이션의 부족을 보완하기 위해 단일 얼굴 3DMM 네트워크를 활용해 약한 지도 학습 기반의 진짜값을 생성한다.
- 3DMM 파라미터(정체성, 표정, 자세, 스케일)를 분리하여 표현 학습과 모델 일반화를 향상시키는 다중 작업 학습 프레임워크를 설계한다.
- 계산 오버헤드와 메모리 사용량을 최소화하여 모바일 플랫폼에서 실시간으로 가벼운 얼굴 동작 리타겟팅을 구현한다.
제안 방법
- 크롭된 단일 얼굴 이미지에서 분리된 3DMM 파라미터를 회귀하기 위해, 파이어 모듈과 스위즈-익스타이션 블록을 활용한 다중 스케일 아키텍처를 사용해 단일 얼굴 네트워크(SFN)를 훈련한다.
- 자세와 스케일에 대해 고수준 특징을 강조하고, 정체성과 표정에 대해 다중 스케일 특징을 활용하여 더 나은 분리 성능을 달성하도록 SFN을 설계한다.
- 훈련된 SFN을 사용해 다중 얼굴 이미지 내 다수의 얼굴에 대해 합성 3DMM 파라미터를 생성하고, 이를 다중 얼굴 네트워크(MFN) 훈련을 위한 약한 지도 학습 기반의 지도값으로 활용한다.
- YOLO 기반의 단일 스풍의 검출기로, 한 번의 순방향 전파에서 얼굴 바운딩 박스와 3DMM 파라미터를 동시에 예측하는 MFN을 설계한다.
- 스케일 사전 정보와 다중 스케일 특징 융합을 통합하여 극단적인 자세와 표정 조건에서도 검출 강건성과 파라미터 정확도를 향상시킨다.
- 검출과 3DMM 회귀를 공동으로 훈련시켜 네트워크가 독립적인 얼굴 특징을 학습하도록 유도함으로써, 검출 및 리타겟팅 성능을 모두 향상시킨다.
실험 결과
연구 질문
- RQ1캐스케이드 방법보다 더 높은 효율성을 확보하면서, 단일 딥 러닝 네트워크가 다중 얼굴 검출과 3DMM 파라미터 회귀를 동시에 수행하여 얼굴 동작 리타겟팅을 수행할 수 있는가?
- RQ2다중 작업 학습 프레임워크 내에서 3DMM 파라미터 예측을 어떻게 분리하여 정체성, 표정, 자세 변화에 대한 강건성을 향상시킬 수 있는가?
- RQ3실제 3DMM 데이터가 없는 상황에서 단일 얼굴 모델로부터 생성된 약한 지도 학습 기반의 3DMM 파라미터가 다중 얼굴 훈련에 얼마나 기여하는가?
- RQ4검출과 3DMM 회귀를 공동으로 훈련시키는 것이 별도로 훈련시키는 것보다 검출 정확도와 표정 전달 품질을 향상시키는가?
- RQ5제안된 방법은 복잡하고 제약이 없는 환경에서도 높은 정확도를 유지하면서 모바일 디바이스에서 실시간 성능을 달성할 수 있는가?
주요 결과
- 제안된 MFN은 AFW 데이터셋에서 mAP 98.8%를 달성하여 동일한 설정에서 Hyperface(97.9%)와 Faceness-Net(97.2%)를 모두 능가한다.
- 공동 검출 및 리타겟팅 네트워크는 얼굴 수에 관계없이 프레임당 39ms로 추론 시간을 단축시켰으며, 캐스케이드 방법 대비 빠른 성능을 보였다(1개 얼굴: 49ms, 10개 얼굴: 184ms).
- 검출과 리타겟팅을 하나의 네트워크로 통합함으로써, 별도의 검출기 + SFN의 13.5MB에서 13MB로 메모리 프로파일을 감소시켰다.
- 다중 스케일 SFN은 눈 표정에 대해 2D 랜드마크 오차 0.016, 눈썹 분노 표정에 대해 0.131을 기록하여 단일 스케일 SFN(각각 0.082 및 0.331)보다 뛰어난 성능을 보이며, 더 나은 분리 성능을 입증했다.
- 다중 스케일 SFN에서 유도된 진짜값을 사용해 훈련된 MFN는 SFN(0.229)과 동일한 3D 얼굴 동작 리타겟팅 정확도(NME: 0.229)를 달성했으며, 다중 얼굴 데이터에서 훈련된 점을 고려했을 때 놀라운 성능이다.
- 300VW 및 WIDER 데이터셋에서의 시각적 결과는 극단적인 표정과 자세에 대해서도 정확한 3D 메쉬 재구성과 바운딩 박스 예측을 가능하게 하여 강건성을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.