Skip to main content
QUICK REVIEW

[논문 리뷰] Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion

Sen Chen, Zhilei Liu|arXiv (Cornell University)|2022. 04. 27.
Speech and Audio Processing인용 수 7
한 줄 요약

이 논문은 음성과 말과 관련된 얼굴 운동 단위(AUs)를 주행 신호로 활용하여 다중모달 특징 융합을 위한 확장된 비인과적 시간적 컨volutional 자기주의 네트워크(TCSAN)를 사용하는 새로운 대화 헤드 생성 프레임워크를 제안한다. 음성-AU 예측과 AU 인식 손실을 통합함으로써 입모양 동기화 정확도와 이미지 품질을 향상시켜, GRID 및 TCD-TIMIT 데이터셋에서 최신 기술을 초월한다.

ABSTRACT

Talking head generation is to synthesize a lip-synchronized talking head video by inputting an arbitrary face image and corresponding audio clips. Existing methods ignore not only the interaction and relationship of cross-modal information, but also the local driving information of the mouth muscles. In this study, we propose a novel generative framework that contains a dilated non-causal temporal convolutional self-attention network as a multimodal fusion module to promote the relationship learning of cross-modal features. In addition, our proposed method uses both audio- and speech-related facial action units (AUs) as driving information. Speech-related AU information can guide mouth movements more accurately. Because speech is highly correlated with speech-related AUs, we propose an audio-to-AU module to predict speech-related AU information. We utilize pre-trained AU classifier to ensure that the generated images contain correct AU information. We verify the effectiveness of the proposed model on the GRID and TCD-TIMIT datasets. An ablation study is also conducted to verify the contribution of each component. The results of quantitative and qualitative experiments demonstrate that our method outperforms existing methods in terms of both image quality and lip-sync accuracy.

연구 동기 및 목표

  • 기존의 대화 헤드 생성 방법이 다중모달 상호작용과 국소적인 입근육 운동 역학을 忽시하는 한계를 해결하기 위해.
  • 말과 관련된 얼굴 운동 단위(AUs)를 보조 주행 신호로 통합하여 입모양 동기화 정확도와 시각적 품질을 향상시키기 위해.
  • 장기적인 시간적 의존성과 다중모달 관계를 포착하는 강력한 다중모달 융합 메커니즘을 개발하기 위해.
  • 사전 훈련된 AU 분류기와 AU 손실을 통해 생성된 얼굴에 올바른 AU 패턴이 포함되도록 보장하기 위해.
  • 교차 데이터베이스 생성을 통해 모델의 일반화 능력을 검증하기 위해.

제안 방법

  • 장기적인 시간적 의존성을 모델링하고 다중모달 특징 상호작용을 향상시키기 위해 확장된 비인과적 시간적 컨volutional 자기주의 네트워크(TCSAN)를 도입한다.
  • 음성 입력에서 말과 관련된 얼굴 운동 단위(AUs)를 예측하는 음성-AU 모듈을 설계하여 국소적인 입운동 가이던스를 제공한다.
  • 사전 훈련된 AU 분류기를 활용하여 AU 손실 구성 요소를 통해 생성 프레임에 현실적인 AU 패턴을 강제한다.
  • 재구성 손실, 인지 손실, 신원 손실, 그리고 AU 손실을 조합하여 이미지 정밀도와 동기화를 향상시킨다.
  • 과거와 미래의 컨텍스트를 모두 활용하는 비인과적 TCN 아키텍처를 사용하여, 인과적 RNN이나 TCN보다 더 나은 시간 모델링을 가능하게 한다.
  • TCSAN 모듈을 통해 음성과 AU 특징을 융합하여 상호모달 관계를 포착하는 공동 표현 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1말과 관련된 얼굴 운동 단위(AUs)를 주행 신호로 통합하면 대화 헤드 생성에서 입모양 동기화 정확도가 향상되는가?
  • RQ2확장된 비인과적 시간적 컨volutional 자기주의 네트워크(TCSAN)는 음성과 얼굴 운동 간의 다중모달 관계를 얼마나 효과적으로 모델링하는가?
  • RQ3음성-AU 모듈은 음성 전용 주행에 비해 입운동의 현실성과 정밀도를 향상시키는가?
  • RQ4제안된 다중모달 융합 메커니즘은 기준 모델 대비 이미지 품질과 시간적 일관성에 얼마나 기여하는가?
  • RQ5모델은 데이터셋 간 일반화가 가능할까? 예를 들어, GRID에서 훈련된 모델이 TCD-TIMIT 데이터셋에서 고품질의 대화 헤드를 생성할 수 있는가?

주요 결과

  • 제안된 모델은 이미지 품질과 입모양 동기화 정확도 측면에서 모두 GRID 및 TCD-TIMIT 데이터셋에서 최신 기술을 초월하는 성능을 달성한다.
  • 절단 실험을 통해 TCSAN 모듈과 AU 손실이 모두 생성 품질과 동기화에 크게 기여하는 것으로 확인되었다.
  • 음성-AU 모듈은 음성에서 말과 관련된 AUs를 효과적으로 예측하여 더 정확하고 자연스러운 입운동을 이끌어낸다.
  • 침묵된 음성 입력이 주어져도 모델은 높은 시각적 정밀도를 유지하며 부적절한 입운동을 억제함으로써 강건성을 보여준다.
  • GRID에서 훈련된 모델을 TCD-TIMIT 데이터셋에 적용한 교차 데이터베이스 생성 결과는 강력한 일반화 능력을 보이며, 일관되고 정확한 입운동이 입력 음성과 일치함을 확인했다.
  • 정성적 결과에서는 전체 모델이 기준 모델 대비 얼굴 질감, 이가 선명도, 입모양 동기화 측면에서 뛰어난 성능을 보였으며, 그림 11의 빨간 박스 예시들은 동기화 오류가 감소한 것을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.