Skip to main content
QUICK REVIEW

[논문 리뷰] GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation

Zhenhui Ye, Jinzheng He|arXiv (Cornell University)|2023. 05. 01.
Face recognition and analysis인용 수 5
한 줄 요약

GeneFace++는 실시간, NeRF 기반의 음성 주도 3D 대화하는 얼굴 생성 방법을 제안하며, 일반화된 음성-입술 동기화, 높은 영상 품질, 빠른 추론을 달성한다. 이는 시간적 스무딩과 함께 톤 인식 음성-운동 모듈과 지역적 선형 통합(LLE) 후처리 방법을 도입하여 운동 일관성과 강건성을 향상시켜 안정적이고 실시간으로 렌더링할 수 있도록 한다. 최신 기술 수준의 성능을 구현한다.

ABSTRACT

Generating talking person portraits with arbitrary speech audio is a crucial problem in the field of digital human and metaverse. A modern talking face generation method is expected to achieve the goals of generalized audio-lip synchronization, good video quality, and high system efficiency. Recently, neural radiance field (NeRF) has become a popular rendering technique in this field since it could achieve high-fidelity and 3D-consistent talking face generation with a few-minute-long training video. However, there still exist several challenges for NeRF-based methods: 1) as for the lip synchronization, it is hard to generate a long facial motion sequence of high temporal consistency and audio-lip accuracy; 2) as for the video quality, due to the limited data used to train the renderer, it is vulnerable to out-of-domain input condition and produce bad rendering results occasionally; 3) as for the system efficiency, the slow training and inference speed of the vanilla NeRF severely obstruct its usage in real-world applications. In this paper, we propose GeneFace++ to handle these challenges by 1) utilizing the pitch contour as an auxiliary feature and introducing a temporal loss in the facial motion prediction process; 2) proposing a landmark locally linear embedding method to regulate the outliers in the predicted motion sequence to avoid robustness issues; 3) designing a computationally efficient NeRF-based motion-to-video renderer to achieves fast training and real-time inference. With these settings, GeneFace++ becomes the first NeRF-based method that achieves stable and real-time talking face generation with generalized audio-lip synchronization. Extensive experiments show that our method outperforms state-of-the-art baselines in terms of subjective and objective evaluation. Video samples are available at https://genefaceplusplus.github.io .

연구 동기 및 목표

  • NeRF 기반의 대화하는 얼굴 생성에서 장기적인 시간적 불일치와 낮은 음성-입술 동기화 정확도 문제를 해결한다.
  • 과도한 입술 움직임과 같은 이방성(OOD) 얼굴 운동에 대한 강건성을 향상시켜 렌더링 품질 저하를 방지한다.
  • 고품질 영상과 3D 일관성을 유지하면서 실시간 추론을 가능하게 하기 위해 시스템 효율성을 향상시킨다.
  • 다양한 음성 입력, 특히 신원 간, 언어 간, 노래 음성 등에 걸쳐 일반화된 성능을 달성한다.
  • 기존 NeRF 기반 방법의 훈련 안정성, 추론 속도, 렌더링 정밀도의 한계를 극복한다.

제안 방법

  • 입술 동기화 정확도와 시간적 일관성을 향상시키기 위해 음성-운동 모듈에 보조 음성 특징으로 음정 곡선을 도입한다.
  • 장기간의 시퀀스에서 진동을 줄이고 운동의 매끄러움을 햖스르기 위해 장면 예측 시 시간적 스무딩 손실을 적용한다.
  • 예측된 얼굴 랜드마크를 타겟 신체의 다양체(manifold)로 투영함으로써 이상치를 처리하는 Landmark Locally Linear Embedding(LLE)을 제안하여 강건성을 향상시킨다.
  • 초기화된 추론 속도를 최적화한 하이퍼좌표 기반 NeRF를 사용해 계산 효율성이 높은 즉각적인 운동-영상 렌더러를 설계한다.
  • 모델 용량과 렌더링 품질의 균형을 맞추기 위해 얼굴 랜드마크에 3D 하이퍼좌표 표현을 사용한다.
  • 렌더러에서 Postnet을 통한 적대적 도메인 적응을 통합하여 예측된 운동을 훈련 분포와 일치시켜 렌더링 잡음 감소를 달성한다.

실험 결과

연구 질문

  • RQ1음정 곡선을 보조 특징으로 통합함으로써 장기적인 대화하는 얼굴 생성에서 입술 동기화와 시간적 일관성이 향상되는가?
  • RQ2LLE와 같은 다양체 기반 후처리 방법이 이방성 얼굴 운동으로 인한 렌더링 실패를 효과적으로 줄일 수 있는가?
  • RQ3경량화된 즉각적인 운동-영상 NeRF 렌더러가 영상 품질이나 3D 일관성을 희생시키지 않고 실시간 추론을 달성할 수 있는가?
  • RQ4제안된 방법이 노래 및 이종 신원 음성과 같은 다양한 음성 입력에 어떻게 일반화되는가?
  • RQ5운동-영상 렌더링 파이프라인에서 모델 용량(Hyper-coordinate 차원)과 추론 속도 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 톤 인식 음성-운동 모듈은 기준 모델 대비 LMD를 12.8% 감소시키고 Sync 점수를 1.05점 향상시켜 입술 동기화 정확도와 시간적 안정성을 크게 향상시켰다.
  • LLE를 사용할 경우 α=1.0일 때 악성 케이스 비율을 LLE 없이 51.3%에서 10.2%로 감소시켰으며, Sync 점수는 약간 감소하여 OOD 랜드마크 처리에 효과적임을 입증했다.
  • LLE에서 α=0.5를 사용할 경우 최적의 트레이드오프를 달성하여 악성 케이스 비율을 16.4%로 감소시키면서도 높은 입술 동기화 품질을 유지했다.
  • 하이퍼좌표 차원을 2에서 3으로 증가시켜 입술 영역의 PSNR를 0.32 dB 향상시켜(31.13 → 31.22), 고주파 입술 동역학을 더 잘 모델링함을 시사했다.
  • 즉각적인 운동-영상 렌더러는 3D 하이퍼좌표를 사용해 23.55 FPS를 달성하여 실시간 추론을 가능하게 하였고, 얼굴의 PSNR는 31.22, 입술의 PSNR는 30.21을 유지했다.
  • 제거 실험 결과, 톤 인식 모델링과 LLE 모두 강건성과 성능 향상에 필수적이며, 둘 중 하나를 제거할 경우 LMD와 Sync 점수에 심각한 저하가 발생함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.