[论文解读] AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene Synthesis
AV-NeRF 提出了一种基于 NeRF 的新框架,用于从真实世界视频记录中合成逼真的音视频场景,整合了声学感知的音频生成、几何感知的声音传播以及以声源为中心的坐标变换。该方法在真实世界(RWAVS)和合成(SoundSpaces)数据集上均达到最先进性能,音频质量指标最高提升达 39%。
Can machines recording an audio-visual scene produce realistic, matching audio-visual experiences at novel positions and novel view directions? We answer it by studying a new task -- real-world audio-visual scene synthesis -- and a first-of-its-kind NeRF-based approach for multimodal learning. Concretely, given a video recording of an audio-visual scene, the task is to synthesize new videos with spatial audios along arbitrary novel camera trajectories in that scene. We propose an acoustic-aware audio generation module that integrates prior knowledge of audio propagation into NeRF, in which we implicitly associate audio generation with the 3D geometry and material properties of a visual environment. Furthermore, we present a coordinate transformation module that expresses a view direction relative to the sound source, enabling the model to learn sound source-centric acoustic fields. To facilitate the study of this new task, we collect a high-quality Real-World Audio-Visual Scene (RWAVS) dataset. We demonstrate the advantages of our method on this real-world dataset and the simulation-based SoundSpaces dataset.
研究动机与目标
- 为解决从真实世界记录中合成一致且沉浸式的音视频场景在新相机位姿下的挑战。
- 建模反映物理声音传播的空间音频,包括距离衰减和与头部方向相关的双耳线索。
- 开发一种多模态神经场,融合视觉几何与材质属性以及声场学习,以提升真实感。
- 创建并发布一个高质量的真实世界音视频数据集(RWAVS),以支持该新任务的基准测试。
- 在真实与合成环境中均证明所提方法优于现有基线方法。
提出的方法
- AV-NeRF 采用双分支架构:V-NeRF 负责视觉渲染,A-NeRF 负责基于听者位置和头部方向学习连续声场。
- AV-Mapper 模块将 V-NeRF 中的几何与材质特征注入 A-NeRF,实现尊重物理声音传播的声学感知音频生成。
- 坐标变换机制将观察方向相对于声源进行表达,使模型能够学习以声源为中心的声场。
- 模型使用相对角度嵌入而非位置编码,以更好地捕捉方向性音频感知。
- 音频生成基于 3D 场景几何与材质属性,实现距离敏感且方向感知的双耳声音生成。
- 该框架通过真实世界记录的视频帧、相机位姿和双耳音频进行端到端训练。
实验结果
研究问题
- RQ1神经场模型能否在真实世界的音视频场景中,于新相机轨迹上生成一致且逼真的双耳音频与视频?
- RQ2如何将声音传播的物理原理(如能量衰减和头相关传输函数)整合进神经渲染框架?
- RQ3在声场学习中,以声源为参考表示声音方向与使用绝对坐标相比有何影响?
- RQ4视觉几何与材质信息的多模态融合如何提升音频合成质量?
- RQ5单一神经场在多样化的室内外环境中,能在多大程度上同时表征视觉与空间音频内容?
主要发现
- 在 MAG 音频质量指标上,AV-NeRF 相较于先前最先进方法 INRAS 实现 39% 的相对提升(0.956 vs. 1.504),在 ENV 指标上提升 11.6%。
- 在 SoundSpaces 数据集上,AV-NeRF 将 T60 指标相对 INRAS 降低 21%,达到 2.47,而 INRAS 为 3.14。
- AV-NeRF 在 MAG 上优于 ViGAS 1.504,在 ENV 上优于 0.145,表明其在不同视角下具有更优的泛化能力。
- 消融实验确认 AV-Mapper 和坐标变换均至关重要,其移除会显著降低音频质量。
- 使用相对角度嵌入优于绝对或相对角度的位置编码,凸显了感知上有意义音频表征的重要性。
- 通过视觉与定量分析验证,该模型生成的双耳音频在信号包络与双耳时间差方面与真实值高度一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。