[논문 리뷰] Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion
이 논문은 단일 기준 이미지와 오디오로부터 사진처럼 생긴, 리듬감 있는 머리 동작을 생성하는 새로운 오디오 주도 대화 헤드 생성 프레임워크인 Audio2Head를 제안한다. 운동 인식 RNN과 관건점 기반의 조밀한 운동장 영역 표현을 사용하여 머리 동작 예측과 표정 생성을 분리함으로써, 배경 잡음이 최소화된 동기화되고 자연스러운 머리 동작을 달성하며, 시각적 품질과 운동 현실감에서 기존 최고 수준(SOTA)을 초월한다.
We propose an audio-driven talking-head method to generate photo-realistic talking-head videos from a single reference image. In this work, we tackle two key challenges: (i) producing natural head motions that match speech prosody, and (ii) maintaining the appearance of a speaker in a large head motion while stabilizing the non-face regions. We first design a head pose predictor by modeling rigid 6D head movements with a motion-aware recurrent neural network (RNN). In this way, the predicted head poses act as the low-frequency holistic movements of a talking head, thus allowing our latter network to focus on detailed facial movement generation. To depict the entire image motions arising from audio, we exploit a keypoint based dense motion field representation. Then, we develop a motion field generator to produce the dense motion fields from input audio, head poses, and a reference image. As this keypoint based representation models the motions of facial regions, head, and backgrounds integrally, our method can better constrain the spatial and temporal consistency of the generated videos. Finally, an image generation network is employed to render photo-realistic talking-head videos from the estimated keypoint based motion fields and the input reference image. Extensive experiments demonstrate that our method produces videos with plausible head motions, synchronized facial expressions, and stable backgrounds and outperforms the state-of-the-art.
연구 동기 및 목표
- 단일 기준 이미지로부터 오디오에 동기화된 사진처럼 생긴 자연스러운 머리 동작을 갖춘 현실적인 대화 헤드 영상 생성
- 학습 데이터에서 머리 동작-오디오 대응의 모호함에 도전
- 큰 머리 자세 변화 시 비얼 영역(예: 머리카락, 배경)에서의 시각적 잡음 억제
- 생성된 영상 시퀀스에서 시간적 및 공간적 일관성 향상
- 기존 최고 수준의 방법에 비해 뛰어난 시각적 품질과 운동 현실감 달성
제안 방법
- 운동 인식 순환 신경망(RNN)이 오디오에서 6자리 강성 머리 자세를 예측하여 저주파수의 통합 머리 동작을 모델링한다.
- 관건점 기반의 조밀한 운동장 영역 표현을 사용하여 얼굴 영역, 머리, 배경의 운동을 동시에 모델링한다.
- 이미지 운동장 영역 생성기가 상대적 관건점 이동을 사용하여 오디오, 예측된 머리 자세, 기준 이미지에서 조밀한 운동장 영역을 생성한다.
- 운동장 영역을 이용해 기준 이미지를 미분 가능 워핑으로 왜곡함으로써 고해상도 영상 합성 가능하다.
- 신경 이미지 생성 네트워크가 왜곡된 특징과 운동장 영역에서 사진처럼 생긴 프레임을 렌더링한다.
- 픽셀 수준의 일관성 손실과 구조적 유사도(SSIM) 손실을 사용한 두 단계 학습 전략이 시간적 일관성과 시각적 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1단일 이미지 기반, 오디오 주도 대화 헤드 생성 모델은 말의 억양에 맞는 자연스럽고 리듬감 있는 머리 동작을 생성할 수 있는가?
- RQ2머리 동작 예측을 표정 생성에서 분리하여 모호성을 줄이고 현실감을 향상시킬 수 있는가?
- RQ3큰 머리 자세 변화 시 얼굴 및 비얼 영역에서 운동을 효과적으로 모델링하고 안정화할 수 있는가?
- RQ4운동장 영역 정규화와 손실 함수는 시간적 일관성과 시각적 품질에 어떤 영향을 미치는가?
- RQ5SOTA 기준에 비해 제안된 방법은 입술 동기화 정확도, 머리 동작 품질, 배경 잡음 억제 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 방법은 사용자 평가에서 자연스러움 평가 점수 66.7% (5점 척도에서 4점 이상)를 기록하여 모든 SOTA 방법을 뛰어넘었다.
- VoxCeleb에서의 정량적 평가에서 PSNR 21.19와 SSIM 0.68를 달성하여 강력한 시각적 정확도를 입증했다.
- 절단 실험 결과, 자코비안 정규화를 제거할 경우 입술 움직임이 비자연스러워지고, SET 모듈나 두 번째 학습 단계를 생략할 경우 진동이 증가하며 동기화가 떨어졌다.
- 큰 머리 자세 변화 조건에서도 안정적인 배경을 유지하며, 질감 왜곡이나 잡음이 최소화되었다.
- 모델은 뛰어난 운동 현실감을 달성하여 사용자들이 기준 방법보다 머리 동작이 더 자연스럽고 리듬감 있게 느껴진다고 평가했다.
- 비립음 및 입술 접촉 음소(예: p, f, m)에서 입술 동기화 정확도가 약간 떨어지지만, 전체적으로는 시각적 품질과 운동 현실감이 사용자에게 더 선호되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.