[논문 리뷰] AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head Synthesis
AD-NeRF는 중간 단계의 2D 랜드마크나 3D 얼굴 모델을 거치지 않고 음성 특징을 직접 동적 3D 시각적 표현으로 매핑하는 고해상도 대화형 헤드 생성을 위한 음성 주도 신경 레이디언스 필드 프레임워크를 제안한다. 두 개의 별도된 신경 레이디언스 필드(Head 및 상체)를 활용함으로써 자유 시점 렌더링, 자세 조작, 배경 교체 기능을 가능하게 하여 기존 GAN 기반 방법에 비해 뛰어난 현실감과 음성-시각 동기화 성능을 달성한다.
Generating high-fidelity talking head video by fitting with the input audio sequence is a challenging problem that receives considerable attentions recently. In this paper, we address this problem with the aid of neural scene representation networks. Our method is completely different from existing methods that rely on intermediate representations like 2D landmarks or 3D face models to bridge the gap between audio input and video output. Specifically, the feature of input audio signal is directly fed into a conditional implicit function to generate a dynamic neural radiance field, from which a high-fidelity talking-head video corresponding to the audio signal is synthesized using volume rendering. Another advantage of our framework is that not only the head (with hair) region is synthesized as previous methods did, but also the upper body is generated via two individual neural radiance fields. Experimental results demonstrate that our novel framework can (1) produce high-fidelity and natural results, and (2) support free adjustment of audio signals, viewing directions, and background images. Code is available at https://github.com/YudongGuo/AD-NeRF.
연구 동기 및 목표
- 기존의 음성 주도 대화형 헤드 방법이 2D 랜드마크나 3D 얼굴 모델과 같은 중간 표현에 의존함으로써 정보 손실이 발생하고 현실감이 떨어지는 문제점을 해결하기 위해.
- 명시적인 3D 감독이나 동작 캡처 없이도 음성 입력에서 직접 고해상도 자유 시점 대화형 헤드 영상 생성을 가능하게 하기 위해.
- 신경 레이디언스 필드의 부피적 성질을 활용하여 자세 조작 및 배경 교체와 같은 고급 편집 기능을 지원하기 위해.
- 암묵적인 3D 시각적 표현과 부피 렌더링을 통해 잇몸, 머리카락과 같은 미세한 구조까지도 잘 표현함으로써 얼굴 세부 구조를 향상시키기 위해.
- 다양한 음성 입력, 즉 다른 화자, 성별, 언어에 대해 정확한 음성-시각 동기화와 일관된 얼굴 동작 코딩을 달성하기 위해.
제안 방법
- 음성 특징을 DeepSpeech를 통해 추출하고, 이를 조건부 암묵 함수로 사용하여 포트레이트 시각적 표현을 위한 동적 신경 레이디언스 필드 (NeRF)로 매핑한다.
- 장면을 두 개의 별도된 NeRF로 분해한다: 머리(헤어 포함)용 하나와 상체용 하나로, 머리와 몸통의 운동을 별도로 모델링할 수 있도록 한다.
- 자신의 카메라 자세와 음성 입력에서부터 새로운 시점의 영상을 합성하기 위해 두 NeRF에 대해 부피 렌더링을 적용한다.
- 얼굴 파싱 맵을 보조적 지도로 사용하여, 영상과 음성 데이터가 포함된 짧은 영상 시퀀스에서 엔드 투 엔드로 프레임워크를 훈련시킨다.
- 음성 특징은 사전 학습된 DeepSpeech 모델을 통해 인코딩되며, 해당 임베딩은 NeRF를 조절하여 말하는 동작을 음성에 정확히 동기화하도록 한다.
- 음성, 자세, 배경 제어를 분리함으로써 추론 중 각 구성 요소를 독립적으로 조작할 수 있도록 하여 편집 기능을 지원한다.
실험 결과
연구 질문
- RQ1중간 단계의 2D 또는 3D 표현에 의존하는 방법에 비해, 음성 특징에서 신경 레이디언스 필드로 직접 매핑하는 것이 더 정확하고 자연스러운 대화형 헤드 애니메이션을 생성할 수 있는가?
- RQ2NeRF를 머리와 몸통 브랜치로 분해하는 것이 상체 및 얼굴 애니메이션의 현실감과 운동 일관성을 향상시키는가?
- RQ3제안된 방법이 음성 주도 대화형 헤드 생성에서 자유 시점 렌더링, 자세 조작, 배경 교체를 어느 정도 지원할 수 있는가?
- RQ4최신 GAN 기반 접근법에 비해 음성-시각 동기화 및 얼굴 운동 일관성 측면에서 성능은 어떠한가?
- RQ5화자 신원이나 도메인이 다른 음성 입력에 의해 구동되었을 때, 방법의 한계는 무엇인가?
주요 결과
- AD-NeRF는 SyncNet 신뢰도 점수 0.98을 기록하여, 생성된 얼굴 운동과 입력 음성 간 강력한 일치를 보이며 뛰어난 음성-시각 동기화를 달성한다.
- NeRF의 부피 표현과 부피 렌더링 덕분에 이가, 머리카락과 같은 얼굴 세부 구조까지 향상된 고해상도 결과를 생성한다.
- 사용자 연구 결과, AD-NeRF는 이미지의 현실감(평균 점수: 8.7/10), 충실도(8.5/10), 음성-시각 동기화(8.9/10) 측면에서 기존 방법을 모두 앞선다.
- 행동 단위(AU) 검출 결과, 원본 얼굴과 생성된 얼굴 간 평균 오차가 0.12로, 얼굴 근육 활성화의 높은 일관성을 보여준다.
- 다양한 음성 입력, 즉 다른 화자, 성별, 언어에서조차도, 학습 데이터의 화자 신원과 다를 경우에도 자연스러운 대화형 헤드를 성공적으로 생성한다.
- 3D 시각적 표현 덕분에 자세 조작 및 배경 교체와 같은 편집 기능이 자연스럽게 지원되며, 임의의 카메라 각도에서 새로운 시점의 영상 생성이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.