[논문 리뷰] 4DFAB: A Large Scale 4D Facial Expression Database for Biometric Applications
4DFAB은 5년에 걸쳐 4회 세션 동안 촬영한 180명의 주제를 포함하는 대규모 4D 얼굴 표정 데이터베이스로, 고해상도 3D 얼굴 메ッシュ가 180만 개 이상 포함되어 있다. 이 데이터베이스를 통해 고도의 정교한 생체인식 응용, 표정 인식, 그리고 고정밀 블렌드쉐이프 모델링이 가능하며, 이는 이전 모델들에 비해 표정 복원 성능에서 뚜렷한 우수성을 보이며, 얼굴 운동을 이용한 새로운 동적 신원 확인 기술을 가능하게 한다.
The progress we are currently witnessing in many computer vision applications, including automatic face analysis, would not be made possible without tremendous efforts in collecting and annotating large scale visual databases. To this end, we propose 4DFAB, a new large scale database of dynamic high-resolution 3D faces (over 1,800,000 3D meshes). 4DFAB contains recordings of 180 subjects captured in four different sessions spanning over a five-year period. It contains 4D videos of subjects displaying both spontaneous and posed facial behaviours. The database can be used for both face and facial expression recognition, as well as behavioural biometrics. It can also be used to learn very powerful blendshapes for parametrising facial behaviour. In this paper, we conduct several experiments and demonstrate the usefulness of the database for various applications. The database will be made publicly available for research purposes.
연구 동기 및 목표
- 생체인식 응용을 지원하는 대규모 다중 세션 4D 얼굴 데이터베이스의 부족을 해결하기 위해.
- 더 현실적인 얼굴 행동 모델링을 위해 포즈 촬영과 자연스러운 표정을 모두 포함한 종합적인 데이터셋을 제공하기 위해.
- 시간에 따른 얼굴 운동을 활용해 강력한 동적 얼굴 인식 및 확인 시스템 개발을 가능하게 하기 위해.
- 정확한 3D 얼굴 표정 합성에 적합한 고품질 대규모 블렌드쉐이프 모델을 구축하기 위해.
제안 방법
- 고해상도 3D 스캐닝을 통해 5년에 걸쳐 4회 세션 동안 180명의 주제를 촬영하여 180만 개 이상의 3D 얼굴 메시를 확보하였다.
- 포즈 촬영과 자연스러운 표정을 모두 수집하였으며, 9단어 발화와 동적 얼굴 행동을 포함하였다.
- 4DFAB 데이터셋을 기반으로 훈련된 새로운 표정 블렌드쉐이프 모델을 구축하여 고정밀도의 얼굴 변형을 표현하였다.
- 3D 모러포믹 모델(3DMM) 피팅을 사용하여 표정 이전 응용을 위한 중립 표적 얼굴를 추출하였다.
- 학습된 블렌드쉐이프 모델을 활용해 원본 주제의 표정을 일관된 토폴로지를 가진 대상 3D 얼굴로 이전하였다.
- 미리 보지 못한 표정에 대한 재구성 오차 지표와 함께 얼굴, 표정, 음성 인식 작업을 통해 성능을 평가하였다.
실험 결과
연구 질문
- RQ1다중 세션 4D 데이터에서 유도된 동적 얼굴 운동은 정적 3D 얼굴 모델을 초월해 얼굴 인식 및 확인 성능을 향상시킬 수 있는가?
- RQ2제안된 블렌드쉐이프 모델은 최신 기술 대비 자연스러운 표정 재구성에 있어 얼마나 효과적인가?
- RQ34DFAB는 얼마나 높은 수준의 현실감 있는 3D 얼굴 애니메이션 합성을 표정 이전 기반으로 지원할 수 있는가?
- RQ4표정에서 유도된 신원 무관한 고밀도 형태 변형을 생체인식 식별에 신뢰성 있게 활용할 수 있는가?
- RQ5다중 세션 데이터는 얼굴 인식 시스템의 일반화 능력과 강건성에 어떤 영향을 미치는가?
주요 결과
- LSTM 기반 모델을 사용한 3D 동적 음성 인식에서 4DFAB 데이터베이스는 77.89%의 인식률을 기록하여 기준 모델을 능가하였다.
- 제안된 블렌드쉐이프 모델은 특히 28개의 구성 요소를 사용할 경우 FaceWarehouse 모델보다 유의미하게 낮은 누적 재구성 오차를 기록하였다.
- 4DFAB 기반 모델을 활용한 표정 이전은 더 현실적인 결과를 도출하였으며, 주름과 같은 미세한 얼굴 디테일을 잘 유지하였다.
- 이 데이터베이스를 통해 생체인식 응용을 위한 동적 얼굴 운동에 대한 최초의 대규모 평가가 가능해졌으며, 유망한 인식 성능을 입증하였다.
- 다중 세션 데이터의 활용은 얼굴 인식 및 확인 작업에서 일관된 성능을 보여주며 모델의 일반화 능력 향상을 입증하였다.
- 4DFAB에서 훈련된 블렌드쉐이프 모델은 더 적은 구성 요소로도 예측 불가능한 자연스러운 표정을 재구성하는 데 기존 모델들을 능가하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.