[논문 리뷰] Talking Head Generation with Audio and Speech Related Facial Action Units
이 논문은 음성과 관련된 얼굴 운동 단위(AUs)를 구동 신호로 통합하여 입모양 동기화 정확도와 현실감을 향상시키기 위해 새로운 순환 생성 네트워크를 제안한다. Audio-to-AU 모듈과 AUC 분류기를 도입함으로써, GRID 및 TCD-TIMIT 데이터셋에서 이미지 품질과 시간적 일관성 측면에서 최신 기술 수준의 성능을 달성한다.
The task of talking head generation is to synthesize a lip synchronized talking head video by inputting an arbitrary face image and audio clips. Most existing methods ignore the local driving information of the mouth muscles. In this paper, we propose a novel recurrent generative network that uses both audio and speech-related facial action units (AUs) as the driving information. AU information related to the mouth can guide the movement of the mouth more accurately. Since speech is highly correlated with speech-related AUs, we propose an Audio-to-AU module in our system to predict the speech-related AU information from speech. In addition, we use AU classifier to ensure that the generated images contain correct AU information. Frame discriminator is also constructed for adversarial training to improve the realism of the generated face. We verify the effectiveness of our model on the GRID dataset and TCD-TIMIT dataset. We also conduct an ablation study to verify the contribution of each component in our model. Quantitative and qualitative experiments demonstrate that our method outperforms existing methods in both image quality and lip-sync accuracy.
연구 동기 및 목표
- 기존 입두개 생성 방법이 국소적인 입 근육 운동 동역학을 忽시함으로써 입모양 동기화 부족과 진동 현상이 발생하는 한계를 해결하기 위해.
- 말과 관련된 얼굴 운동 단위(AUs)를 세밀한 국소적 구동 신호로 통합함으로써 얼굴 애니메이션의 정확도를 향상시키기 위해.
- 신원 유지 및 고해상도 입두개 영상 합성에 음성과 AU 표현을 동시에 활용하는 엔드 투 엔드 프레임워크를 개발하기 위해.
- 프레임 구분자와 AU 감독을 통한 적대적 훈련을 통해 현실감과 시간적 일관성을 향상시키기 위해.
제안 방법
- 입 움직임을 위한 구동 조건으로 음성 임베딩과 예측된 말과 관련된 얼굴 운동 단위(AUs)를 모두 사용하는 순환 생성 네트워크를 도입한다.
- 음성 입력에서 직접적으로 말과 관련된 AU 활성화(예: AU10, AU14, AU20, AU25, AU26)를 예측하는 순차적-순차적 아키텍처를 사용하는 Audio-to-AU 모듈을 설계한다.
- 사전 훈련된 AU 분류기를 사용해 생성된 프레임을 감독함으로써 출력 영상에서 정확한 AU 활성화 패tern이 유지되도록 보장한다.
- 프레임 수준의 구분자를 통해 적대적 훈련을 적용하여 생성된 얼굴 이미지의 현실감과 시각적 품질을 향상시킨다.
- 재구성 손실, 인지 손실, 신원 손실, 적대적 손실, AU 전용 손실을 포함한 다중 구성 요소 손실을 사용하여 공동 최적화를 수행한다.
- 재귀 구조(LSTM 또는 유사 구조 등)를 활용해 연속 프레임 간의 시간적 의존성을 모델링함으로써 진동을 줄이고 움직임의 유연성을 향상시킨다.
실험 결과
연구 질문
- RQ1말과 관련된 얼굴 운동 단위(AUs)를 국소적 구동 신호로 통합하면 음성 기반 입두개 생성에서 입모양 동기화 정확도가 향상되는가?
- RQ2엔드 투 엔드 Audio-to-AU 모듈이 원시 음성 음성에서 AU 활성화를 예측하는 데 얼마나 효과적인가?
- RQ3AU 감독이 음성 전용 기반 대비 생성된 얼굴 운동의 현실감과 정확도를 어느 정도 향상시키는가?
- RQ4적대적 훈련과 AU 인식 손실의 조합이 생성된 입두개 영상의 이미지 품질과 시간적 일관성에 어떤 영향을 미치는가?
주요 결과
- Audio-to-AU 모듈을 포함한 전체 모델은 GRID 데이터셋에서 최고의 PSNR(29.838)와 SSIM(0.769)를 기록하여 모든 아블레이션 변형보다 뛰어난 성능을 보였다.
- GRID 테스트 세트에서 평균 AU F1 스코어는 0.949, 정확도는 90.79%를 기록하여 강력한 AU 생성 정밀도를 입증했다.
- 사용자 연구 결과, 77%의 참가자가 입모양 동기화 정확도에서 제안된 방법을 CRAN [Song et al., 2019]보다 선호했으며, 92%는 영상 유연성에서 선호했다.
- 아블레이션 연구를 통해 각 구성 요소—특히 Audio-to-AU 모듈과 AU 손실—이 입모양 동기화와 시각적 품질 향상에 뚜렷한 기여를 했다.
- Audio-to-AU 모듈의 추가로 기준 모델 대비 평균 AU F1 스코어가 0.22 증가하여 말-근육 대응 관계를 잘 포착함을 입증했다.
- 이 모델은 이미지 품질, 입모양 동기화 정확도, 움직임의 부드러움 측면에서 GRID 및 TCD-TIMIT 데이터셋 모두에서 최신 기술 수준의 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.