[论文解读] Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation
本文提出 SSP-NeRF,一种统一的隐式神经辐射场框架,用于实现高保真度、音频驱动的视频人像生成。通过引入语义感知动态射线采样模块和躯干形变模块,该方法在不依赖显式3D结构的情况下,实现了更优的唇音同步准确率与逼真的头部-躯干运动一致性,其在定量指标与人类评估中均优于先前方法。
Animating high-fidelity video portrait with speech audio is crucial for virtual reality and digital entertainment. While most previous studies rely on accurate explicit structural information, recent works explore the implicit scene representation of Neural Radiance Fields (NeRF) for realistic generation. In order to capture the inconsistent motions as well as the semantic difference between human head and torso, some work models them via two individual sets of NeRF, leading to unnatural results. In this work, we propose Semantic-aware Speaking Portrait NeRF (SSP-NeRF), which creates delicate audio-driven portraits using one unified set of NeRF. The proposed model can handle the detailed local facial semantics and the global head-torso relationship through two semantic-aware modules. Specifically, we first propose a Semantic-Aware Dynamic Ray Sampling module with an additional parsing branch that facilitates audio-driven volume rendering. Moreover, to enable portrait rendering in one unified neural radiance field, a Torso Deformation module is designed to stabilize the large-scale non-rigid torso motions. Extensive evaluations demonstrate that our proposed approach renders more realistic video portraits compared to previous methods. Project page: https://alvinliu0.github.io/projects/SSP-NeRF
研究动机与目标
- 解决在不依赖显式3D结构监督的情况下,生成逼真、高保真度音频驱动视频人像的挑战。
- 解决先前两 NeRF 方法在头部与躯干建模中常见的不稳定与不自然的头部-躯干分离问题。
- 通过在射线采样中引入语义感知,提升细粒度面部细节渲染与唇音同步准确率。
- 通过学习姿态相关位移的形变模块,稳定全局非刚性躯干运动。
- 实现统一的端到端神经渲染流程,确保整个肖像在几何与运动上的一致性。
提出的方法
- 语义感知动态射线采样模块包含一个2D人像分割分支,根据面部语义区域引导动态射线采样,优先关注高频率运动区域(如嘴唇与牙齿)。
- 将潜在码锚定在3DMM顶点上,不使用表情参数,以增强面部细节的语义监督。
- 躯干形变模块基于头部姿态与时间流预测3D坐标位移,隐式建模全局躯干运动,防止头部与躯干出现不自然分离。
- 该形变模块以标准头部姿态与时间作为条件,而非音频,以实现音频驱动的面部动态与躯干运动建模之间的解耦。
- 整个框架使用单一 NeRF 渲染完整人像,音频输入同时调制语义与形变组件。
- 模型采用多组件损失进行训练,结合感知损失、重建损失与音视频同步损失。
实验结果
研究问题
- RQ1统一的 NeRF 框架能否有效建模音频驱动人像生成中的局部面部动态与全局头部-躯干运动?
- RQ2与均匀采样相比,语义感知射线采样在提升细节保真度与唇音同步准确率方面有何优势?
- RQ3学习姿态相关位移的形变模块是否能在无显式3D监督的情况下稳定躯干运动?
- RQ4将音频调制在面部动态与躯干形变之间的解耦是否能带来更一致且逼真的结果?
- RQ5在图像质量、唇音同步与运动一致性方面,该方法与最先进方法相比表现如何?
主要发现
- SSP-NeRF 在测试集上取得 PSNR 32.785、SSIM 0.876、LMD 4.495 与 Sync 4.993 的指标,所有指标均优于先前方法。
- 消融实验表明,若移除语义分支,PSNR 下降 3.306,Sync 下降 0.431,证实其在细节与同步方面的重要性。
- 与均匀采样相比,动态射线采样组件使 PSNR 提升 0.271,Sync 提升 0.104。
- 与无形变模块的基线相比,躯干形变模块使 PSNR 损失降低 4.711,Sync 损失降低 0.872,证明其在稳定躯干运动方面的有效性。
- 可视化结果表明,形变模块主要影响躯干区域,并随头部姿态增大而学习更大的位移,表明其成功学习了全局运动。
- 人类评估确认,SSP-NeRF 生成的视频人像比现有方法更具真实感与一致性,尤其在唇音同步与自然的头部-躯干协调方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。