Skip to main content
QUICK REVIEW

[논문 리뷰] A Neural Virtual Anchor Synthesizer based on Seq2Seq and GAN Models

Zipeng Wang, Zhaoxiang Liu|arXiv (Cornell University)|2019. 08. 20.
Face recognition and analysis참고 문헌 40인용 수 4
한 줄 요약

이 논문은 텍스트 입력을 바탕으로 가상 앵커가 말하는 사진처럼 생긴, 시간적으로 일관된 얼굴 영상을 합성하기 위해 새로운 Seq2Seq와 GAN 기반 프레임워크를 제안한다. 단어 임bedding, 얼굴 운동 단위(AU) 및 자세 시퀀스(PS)를 중간 표현으로 사용한다. 이 방법은 말과 동기화된 현실적인 입술 움직임을 구현하며, ESPN 뉴스 영상에 대한 정성적 결과로 검증된다.

ABSTRACT

This paper presents a novel framework to generate realistic face video of an anchor, who is reading certain news. This task is also known as Virtual Anchor. Given some paragraphs of words, we first utilize a pretrained Word2Vec model to embed each word into a vector; then we utilize a Seq2Seq-based model to translate these word embeddings into action units and head poses of the target anchor; these action units and head poses will be concatenated with facial landmarks as well as the former $n$ synthesized frames, and the concatenation serves as input of a Pix2PixHD-based model to synthesize realistic facial images for the virtual anchor. The experimental results demonstrate our framework is feasible for the synthesis of virtual anchor.

연구 동기 및 목표

  • 주어진 텍스트를 읽는 가상 앵커의 사진처럼 생긴, 시간적으로 일관된 얼굴 영상을 생성함으로써, 얼굴 운동이 말하는 내용과 일치하도록 보장한다.
  • 3D 얼굴 모델링의 복잡성을 피하기 위해 중간 표현(AU+PS 및 FLM)을 사용하여 텍스트와 영상 합성 간의 다리를 놓는다.
  • GAN 기반 영상 생성과 시퀀스 모델링을 결합하여 합성 정밀도를 향상시키고, 시간적 일관성을 확보한다.
  • 경량적이고 3D 기반 요소가 없는 방법을 사용하여 엔드 투 엔드 텍스트-투-비디오 합성의 가능성을 입증한다.

제안 방법

  • 입력 텍스트를 200차원 벡터로 표현하기 위해 Word2Vec을 사용하여 시퀀스 표현을 위한 임베딩을 수행한다.
  • LSTM 기반 Seq2Seq 모델이 단어 임베딩을 20D의 AU+PS(17D의 운동 단위 + 3D 머리 자세) 시퀀스로 번역한다.
  • AU+PS 시퀀스는 평균 얼굴 랜드마크(FLM) 및 이전 n개의 합성된 프레임과 결합되어 다중 모odal 입력을 형성한다.
  • 수정된 Pix2PixHD 생성기가 이 결합된 입력을 사용하여 현실적인 얼굴 영상을 합성하며, 적대적 손실, 특징 매칭 손실 및 인지적 손실을 적용한다.
  • 판별기는 생성된 영상과 실제 영상 시퀀스 간의 현실성과 시간적 일관성을 평가한다.
  • 통합 손실 함수는 적대적 손실, 특징 매칭 손실 및 VGG 기반 인지적 손실을 포함하여 영상 품질과 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1Seq2Seq 모델이 텍스트 임베딩을 효과적으로 얼굴 운동 단위와 자세 시퀀스로 매핑하여 현실적인 가상 앵커 애니메이션을 가능하게 할 수 있는가?
  • RQ2AU+PS를 평균 얼굴 랜드마크와 이전에 합성된 프레임과 함께 조합함으로써 생성된 얼굴 영상의 현실성과 시간적 일관성이 향상되는가?
  • RQ3GAN 기반 영상 합성 프레임워크가 입력 텍스트의 언어적 내용과 얼굴 역동성에 부합하는 사진처럼 생긴 얼굴 영상을 생성할 수 있는가?
  • RQ4기존의 3D 기반 또는 직접적인 이미지 투 이미지 번역 방법과 비교했을 때, 제안된 방법은 시각적 정밀도와 동기화 측면에서 어떤가?

주요 결과

  • 정성적 결과를 통해 프레임워크는 입력 텍스트에 동기화된 입술 움직임을 가진 사진처럼 생긴 얼굴 영상을 성공적으로 생성함을 입증했다.
  • AU+PS를 중간 표현으로 사용함으로써 3D 얼굴 모델링이 없이도 정확한 얼굴 운동 예측이 가능해졌다.
  • 평균 얼굴 랜드마크와 이전 프레임을 통합함으로써 학습 안정성이 향상되고, 생성된 시퀀스의 공간-시간 일관성이 향상되었다.
  • 적대적 손실, 특징 매칭 손실 및 인지적 손실의 조합은 현실적인 질감과 표정을 가진 고정밀 영상 합성을 가능하게 했다.
  • 모든 프레임에서 일관된 얼굴 역동성이 유지되었으며, 운동 전환 시에 최소한의 아티팩트나 일관성 없는 요소가 관찰되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.