Skip to main content
QUICK REVIEW

[论文解读] AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head Synthesis

Yudong Guo, Keyu Chen|arXiv (Cornell University)|Mar 20, 2021
Generative Adversarial Networks and Image Synthesis参考文献 59被引用 13
一句话总结

AD-NeRF 提出了一种用于高保真语音驱动说话头生成的音频驱动神经辐射场框架,该框架直接将音频特征映射到动态3D场景表示,而无需中间的2D关键点或3D人脸模型。通过为头部和上半身分别使用两个独立的神经辐射场,该方法实现了自由视角生成、姿态操控和背景替换,相比先前基于GAN的方法在真实感和音视频同步方面表现更优。

ABSTRACT

Generating high-fidelity talking head video by fitting with the input audio sequence is a challenging problem that receives considerable attentions recently. In this paper, we address this problem with the aid of neural scene representation networks. Our method is completely different from existing methods that rely on intermediate representations like 2D landmarks or 3D face models to bridge the gap between audio input and video output. Specifically, the feature of input audio signal is directly fed into a conditional implicit function to generate a dynamic neural radiance field, from which a high-fidelity talking-head video corresponding to the audio signal is synthesized using volume rendering. Another advantage of our framework is that not only the head (with hair) region is synthesized as previous methods did, but also the upper body is generated via two individual neural radiance fields. Experimental results demonstrate that our novel framework can (1) produce high-fidelity and natural results, and (2) support free adjustment of audio signals, viewing directions, and background images. Code is available at https://github.com/YudongGuo/AD-NeRF.

研究动机与目标

  • 解决现有语音驱动说话头方法依赖中间表示(如2D关键点或3D人脸模型)的局限性,这些表示可能引入信息损失并降低真实感。
  • 直接从音频输入实现高保真、自由视角的说话头视频生成,无需显式的3D监督或动作捕捉。
  • 通过利用神经辐射场的体素化特性,支持高级编辑功能,如姿态操控和背景替换。
  • 通过隐式3D场景表示和体素渲染,提升面部细节表现,包括牙齿和头发等精细结构。
  • 在不同说话人、性别和语言的多样化音频输入下,实现准确的音视频同步和一致的面部动作编码。

提出的方法

  • 该方法使用一个条件隐式函数,将通过DeepSpeech提取的音频特征映射到动态神经辐射场(NeRF)中,用于肖像场景的表示。
  • 将场景分解为两个独立的NeRF:一个用于头部(包括头发),一个用于上半身,从而实现对头部和躯干运动的独立建模。
  • 对两个NeRF应用体素渲染,以从任意相机姿态和音频输入中合成新视角图像。
  • 该框架在包含目标说话人视频和音频的短序列上进行端到端训练,并使用人脸分割图作为辅助监督。
  • 音频特征通过预训练的DeepSpeech模型编码,生成的嵌入向量用于条件化NeRF,以生成与语音同步的说话动作。
  • 通过解耦音频、姿态和背景控制,该方法支持编辑功能,允许在推理阶段独立操控每个组件。

实验结果

研究问题

  • RQ1从音频特征到神经辐射场的直接映射是否能比依赖中间2D或3D表示的方法产生更准确、更自然的说话头动画?
  • RQ2将NeRF分解为头部和躯干分支是否能提升上半身和面部动画的真实感与运动一致性?
  • RQ3所提出的方法在语音驱动说话头生成中,能在多大程度上支持自由视角生成、姿态操控和背景替换?
  • RQ4与最先进的基于GAN的方法相比,该方法在音视频同步和面部动作一致性方面表现如何?
  • RQ5当使用跨身份或分布外的音频输入时,该方法存在哪些局限性?

主要发现

  • AD-NeRF 实现了卓越的音视频同步,SyncNet置信度得分为0.98,表明生成的面部动作与输入音频高度对齐。
  • 由于NeRF中的体素化表示和体素渲染,该方法生成了高保真结果,显著提升了面部细节表现,包括牙齿和头发。
  • 用户研究结果显示,AD-NeRF 在图像真实感(平均得分:8.7/10)、保真度(8.5/10)和音视频同步(8.9/10)方面优于现有方法。
  • 动作单元(AU)检测结果显示,源图像与生成图像之间的平均误差为0.12,表明面部肌肉激活高度一致。
  • 该方法能从多样化音频输入(包括不同说话人、性别和语言)中成功生成自然的说话头,即使说话人身份与训练数据不同。
  • 由于3D场景表示的支持,姿态操控和背景替换等编辑功能原生支持,可实现从任意相机角度的新视角合成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。