Skip to main content
QUICK REVIEW

[논문 리뷰] FLNet: Landmark Driven Fetching and Learning Network for Faithful Talking Facial Animation Synthesis

Kuangxiao Gu, Yuqian Zhou|arXiv (Cornell University)|2019. 11. 21.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 8
한 줄 요약

FLNet는 랜드마크 기반의 이중 스트림 네트워크를 제안하여, 워핑 기반의 취득 스트림과 외관 기반의 학습 스트림을 통해 다섯 개의 소스 이미지에서 얻은 얼굴 세부 정보를 융합함으로써 충실도 높은 대화형 얼굴 애니메이션을 합성한다. 이 방법은 특히 단일 이미지 기반 기준에 비해 자주 손실되는 치아와 눈과 같은 미세한 얼굴 세부 정보를 유지하는 데서 뛰어난 정량적 및 정성적 성능을 달성한다.

ABSTRACT

Talking face synthesis has been widely studied in either appearance-based or warping-based methods. Previous works mostly utilize single face image as a source, and generate novel facial animations by merging other person's facial features. However, some facial regions like eyes or teeth, which may be hidden in the source image, can not be synthesized faithfully and stably. In this paper, We present a landmark driven two-stream network to generate faithful talking facial animation, in which more facial details are created, preserved and transferred from multiple source images instead of a single one. Specifically, we propose a network consisting of a learning and fetching stream. The fetching sub-net directly learns to attentively warp and merge facial regions from five source images of distinctive landmarks, while the learning pipeline renders facial organs from the training face space to compensate. Compared to baseline algorithms, extensive experiments demonstrate that the proposed method achieves a higher performance both quantitatively and qualitatively. Codes are at https://github.com/kgu3/FLNet_AAAI2020.

연구 동기 및 목표

  • 치아와 눈과 같이 숨겨진 또는 복잡한 얼굴 세부 정보를 충실도 있게 합성하는 데에 단일 이미지 기반 방법의 한계를 해결하기 위해.
  • 다양한 얼굴 랜드마크를 가진 다중 소스 이미지를 활용하여 얼굴 애니메이션의 충실도를 향상시키기 위해.
  • 워핑 기반 특징 취득과 외관 기반 특징 학습을 융합하여 신원을 유지하면서도 강력한 얼굴 애니메이션을 구현하기 위해.
  • 최종적으로 고품질의 현실적인 얼굴 애니메이션을 엔드 투 엔드로 생성함으로써 후처리 단계를 제거하기 위해.

제안 방법

  • 네트워크는 워핑 기반의 취득 스트림과 외관 기반의 학습 스트림을 갖춘 이중 스트림 아키텍처를 사용한다.
  • 취득 스트림은 랜드마크 정렬 기반으로 다섯 개의 소스 이미지에서 얼굴 영역을 선택하고, 변형하여 융합한다.
  • 학습 스트림은 훈련용 얼굴 공간에서 얼굴 외관 특징을 학습하여 보이지 않거나 누락된 세부 정보를 보완한다.
  • 양 스트림의 출력을 융합하여 최종 얼굴 이미지를 생성함으로써 신원 일致성과 세부 정보 충실도를 확보한다.
  • 다중 이미지 소스 백엔드는 다양한 얼굴 기하학적 구조에 접근할 수 있게 하여, 가림되거나 복잡한 영역의 합성 향상에 기여한다.
  • 모델는 적대적 손실과 인지적 손실을 사용하여 엔드 투 엔드로 훈련되어 현실성과 구조적 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1다양한 랜드마크를 가진 다중 소스 이미지를 사용하면 치아와 눈과 같은 미세한 얼굴 세부 정보의 합성에 도움이 되는가?
  • RQ2워핑 기반 취득과 외관 기반 학습의 융합이 얼굴 애니메이션의 충실도에 어떤 영향을 미치는가?
  • RQ3소스 이미지 백엔드의 크기가 생성된 얼굴 애니메이션의 품질에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 신원과 세부 정보 유지 측면에서 단일 이미지 기반 기준을 초월하는가?
  • RQ5주의 기반 영역 선택 메커니즘이 가림되거나 보이지 않는 얼굴 기하학적 구조를 다룰 때 얼마나 효과적인가?

주요 결과

  • 다섯 개의 소스 이미지를 사용하는 전체 FLNet 모델은 FID 점수(12.8)와 LPIPS 값(0.15)에서 가장 높은 성능을 기록하여 단일 이미지 기반 기준을 크게 능가한다.
  • 절단 실험 결과, 외관 기반 스트림만 사용할 경우 치아와 주름과 같은 세부 정보가 흐려지며, 워핑 스트림만 사용할 경우 숨겨진 영역에서 실패함을 확인할 수 있다.
  • 세 개의 소스 이미지를 사용하는 모델는 단일 이미지 입력보다는 성능이 뛰어나지만 여전히 다섯 개의 이미지 백엔드 버전에 비해 열등하다.
  • 시각화 결과, 주의 마스크가 다양한 소스 이미지에서 최적의 영역을 동적으로 선택하는 것으로 확인되었으며, 예를 들어 한 이미지의 감은 눈과 다른 이미지의 열린 입을 조합하는 데 성공했다.
  • 인터다이탈 컨소넌트(자음) 처리 시에는 랜드마크 구성이 모호하여 실패 케이스가 발생하며, 이는 오디오 기반 보완이 필요함을 시사한다.
  • 모델는 후처리 없이도 고해상도의 현실적인 얼굴 애니메이션을 생성하여 정성적 및 정량적 평가에서 강력성과 현실감을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.