[논문 리뷰] Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation
이 논문은 고해상도 음성 주도 비디오 포트레이트 생성을 위한 통합형 암묵적 신경 렌더링 필드 프레임워크인 SSP-NeRF를 제안한다. 의미 인식 동적 레이 샘플링 모듈과 토르소 변형 모듈을 도입함으로써, 명시적 3D 구조에 의존하지 않고도 입술 동기화 정확도를 향상시키고 자연스러운 머리-몸 움직임 일관성을 달성한다. 이는 정량적 지표와 인간 평가 모두에서 이전 방법들을 능가한다.
Animating high-fidelity video portrait with speech audio is crucial for virtual reality and digital entertainment. While most previous studies rely on accurate explicit structural information, recent works explore the implicit scene representation of Neural Radiance Fields (NeRF) for realistic generation. In order to capture the inconsistent motions as well as the semantic difference between human head and torso, some work models them via two individual sets of NeRF, leading to unnatural results. In this work, we propose Semantic-aware Speaking Portrait NeRF (SSP-NeRF), which creates delicate audio-driven portraits using one unified set of NeRF. The proposed model can handle the detailed local facial semantics and the global head-torso relationship through two semantic-aware modules. Specifically, we first propose a Semantic-Aware Dynamic Ray Sampling module with an additional parsing branch that facilitates audio-driven volume rendering. Moreover, to enable portrait rendering in one unified neural radiance field, a Torso Deformation module is designed to stabilize the large-scale non-rigid torso motions. Extensive evaluations demonstrate that our proposed approach renders more realistic video portraits compared to previous methods. Project page: https://alvinliu0.github.io/projects/SSP-NeRF
연구 동기 및 목표
- 명시적 3D 구조적 지도 없이도 음성 오디오에 의해 주도되는 현실적인 고해상도 비디오 포트레이트 생성에 도전하는 것.
- 이전의 두 개의 NeRF 기반 접근 방식에서 흔히 발생하는 불안정하고 비자연스러운 머리-몸 분리 문제를 해결하는 것.
- 레이어 샘플링에 의미 인식을 통합하여 미세한 얼굴 디테일 렌더링과 입술 동기화 정확도를 향상시키는 것.
- 자세에 따라 변형되는 이동량을 학습하는 변형 모듈을 통해 전반적인 비정규형 몸통 운동을 안정화시키는 것.
- 기하학적 일관성과 운동 일관성을 전체 포트레이트에 걸쳐 유지하는 통합형 엔드 투 엔드 신경 렌더링 파이프라인을 달성하는 것.
제안 방법
- 의미 인식 동적 레이 샘플링 모듈은 얼굴 의미 영역 기반으로 동적 레이 샘플링을 유도하는 2D 포트레이트 분할 브랜치를 포함하며, 고주파 운동 영역(예: 입술, 이가 포함된 영역)을 우선순위로 지정한다.
- 이 방법은 표현 매개변수 없이 3DMM 정점에 잠재 코드를 고정함으로써 얼굴 디테일에 대한 의미 지도를 풍부화시킨다.
- 토르소 변형 모듈은 머리 자세와 시간 흐름에 기반하여 3D 좌표 이동량을 예측하여, 머리에서 분리되지 않도록 전반적인 몸통 운동을 암묵적으로 모델링한다.
- 변형 모듈은 오디오가 아닌 캐논리컬 머리 자세와 시간에 조건을 두어, 음성 주도 얼굴 역학과 몸통 운동 모델링을 분리한다.
- 전체 프레임워크는 전체 포트레이트를 렌더링하기 위해 단일 NeRF를 사용하며, 오디오 입력은 의미 및 변형 구성 요소를 모두 조절한다.
- 모델은 인지적, 재구성, 오디오-시각 동기화 손실을 조합한 다중 구성 요소 손실을 통해 훈련된다.
실험 결과
연구 질문
- RQ1통합형 NeRF 프레임워크는 음성 주도 포트레이트 생성에서 국소적 얼굴 역학과 전반적인 머리-몸 움직임을 효과적으로 모델링할 수 있는가?
- RQ2의미 인식 레이 샘플링은 균일한 샘플링 대비 디테일의 정밀도와 입술 동기화 정확도를 어떻게 향상시키는가?
- RQ3자세에 따라 변형되는 이동량을 학습하는 변형 모듈은 명시적 3D 지도 없이도 몸통 운동을 안정화시킬 수 있는가?
- RQ4얼굴 역학과 몸통 변형 간의 오디오 조절을 분리함으로써 더 일관되고 자연스러운 결과를 도출할 수 있는가?
- RQ5이미 존재하는 최첨단 방법들과 비교할 때, 제안된 방법은 이미지 품질, 입술 동기화, 운동 일관성 측면에서 어떻게 성능을 내는가?
주요 결과
- 테스트 세트에서 SSP-NeRF는 PSNR 32.785, SSIM 0.876, LMD 4.495, Sync 4.993를 기록하여 모든 지표에서 이전 방법들을 능가한다.
- 제거 실험 결과 의미 브랜치를 제거하면 PSNR가 3.306 감소하고 Sync가 0.431 감소함으로써, 이는 디테일과 동기화에 있어 그 중요성을 확인한다.
- 동적 레이 샘플링 구성 요소는 균일한 샘플링 대비 PSNR를 0.271 향상시키고 Sync를 0.104 향상시킨다.
- 토르소 변형 모듈은 변형 없이 기반 모델 대비 PSNR 손실을 4.711 감소시키고 Sync 손실을 0.872 감소시켜, 몸통 운동 안정화에 효과적임을 입증한다.
- 시각화 결과 변형 모듈이 주로 몸통 영역에 영향을 주며, 머리 자세가 증가함에 따라 더 큰 이동량을 학습하고 있음을 확인하여 전반적인 운동을 적절히 학습하고 있음을 시사한다.
- 인간 평가 결과 SSP-NeRF는 기존 방법들보다 더 현실적이고 일관성 있는 비디오 포트레이트를 생성함을 확인하였으며, 특히 입술 동기화와 자연스러운 머리-몸 조율 측면에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.