Skip to main content
QUICK REVIEW

[论文解读] Efficient Region-Aware Neural Radiance Fields for High-Fidelity Talking Portrait Synthesis

Jiahe Li, Jiawei Zhang|arXiv (Cornell University)|Jul 18, 2023
Advanced Vision and Imaging被引用 5
一句话总结

本文提出ER-NeRF,一种面向高保真、实时说话人像合成的区域感知神经辐射场框架。通过引入三平面哈希表示以减少哈希冲突,并设计区域注意力模块以显式建模音频-空间区域交互,ER-NeRF在快速收敛、实时推理和紧凑模型尺寸方面实现了最先进性能。

ABSTRACT

This paper presents ER-NeRF, a novel conditional Neural Radiance Fields (NeRF) based architecture for talking portrait synthesis that can concurrently achieve fast convergence, real-time rendering, and state-of-the-art performance with small model size. Our idea is to explicitly exploit the unequal contribution of spatial regions to guide talking portrait modeling. Specifically, to improve the accuracy of dynamic head reconstruction, a compact and expressive NeRF-based Tri-Plane Hash Representation is introduced by pruning empty spatial regions with three planar hash encoders. For speech audio, we propose a Region Attention Module to generate region-aware condition feature via an attention mechanism. Different from existing methods that utilize an MLP-based encoder to learn the cross-modal relation implicitly, the attention mechanism builds an explicit connection between audio features and spatial regions to capture the priors of local motions. Moreover, a direct and fast Adaptive Pose Encoding is introduced to optimize the head-torso separation problem by mapping the complex transformation of the head pose into spatial coordinates. Extensive experiments demonstrate that our method renders better high-fidelity and audio-lips synchronized talking portrait videos, with realistic details and high efficiency compared to previous methods.

研究动机与目标

  • 解决现有基于NeRF的说话人像方法在推理速度、收敛性和重建质量方面的局限性。
  • 通过利用空间区域稀疏性及对面部运动的非均等贡献,提升动态头部重建效果。
  • 显式建模音频-空间区域交互,以增强唇音同步准确性和局部运动真实感。
  • 在保持高视觉保真度和实时渲染能力的同时,降低模型复杂度和训练时间。
  • 通过自适应姿态编码机制解决头身分离问题,提升结构一致性。

提出的方法

  • 提出三平面哈希表示,将三维空间分解为三个正交平面,通过剪枝空区域实现高效三维特征学习,从而减少哈希冲突。
  • 采用紧凑的基于NeRF的三平面分解,结合三个平面哈希编码器,以提升精度并减少噪声,实现对动态头部几何的表示。
  • 提出区域注意力模块,利用交叉注意力将音频特征与空间区域对齐,显式建模音频驱动的局部运动,而非依赖隐式的MLP融合机制。
  • 设计自适应姿态编码,将复杂的头部姿态变换映射到空间坐标,简化躯干-NeRF对姿态相关外观的学习。
  • 通过将稀疏特征网格与基于注意力的条件注入相结合,优化训练效率,降低对大型、低效MLP的依赖。
  • 采用轻量化架构并最小化参数量,实现实时推理的同时保持高保真渲染效果。

实验结果

研究问题

  • RQ1显式建模空间区域感知是否能提升基于NeRF的说话人像中音频驱动的面部运动合成效果?
  • RQ2与隐式的MLP-融合方法相比,区域感知注意力机制在唇音同步准确性和视觉质量方面表现如何?
  • RQ3三平面哈希表示在动态头部建模中能在多大程度上减少哈希冲突,并提升收敛性和重建质量?
  • RQ4紧凑的自适应姿态编码机制是否能有效解耦头部与躯干运动,而无需复杂监督?
  • RQ5区域感知表示与注意力机制的结合是否能在保持最先进性能的同时实现更快收敛和实时推理?

主要发现

  • ER-NeRF在所有对比方法中取得了最高的平均意见评分(MOS),在唇音同步准确性和视频真实感方面表现最优,甚至优于大规模模型SynObama。
  • 所提出的三平面哈希表示相比基线MLP和iNGP方法,PSNR提升1.03–1.14分,LPIPS降低0.071–0.073。
  • 采用通道级注意力的区域注意力模块在LMD(2.740)和Sync(5.708)评分上表现最佳,显著优于特征级注意力和拼接基线方法。
  • 仅需一半的训练时间且参数量更少,ER-NeRF在图像质量和唇音同步方面优于现有方法。
  • 即使在训练中未见的大角度旋转姿态下,ER-NeRF仍能保持高结构准确性,展现出对大旋转角度的鲁棒性。
  • 模型采用紧凑架构实现实时推理,适用于虚拟形象和视频会议等实际应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。