[论文解读] Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video
本文提出了一种几何感知的多任务学习框架,利用视觉几何信息——如房间混响响应、声源空间对齐以及物体位置的时间一致性——将单声道视频音频转换为逼真的双耳音频。通过显式建模视频中的空间与几何线索,该方法在真实和模拟数据集上均取得了最先进性能,包括一个名为 SimBinaural 的新型大规模照片级真实感双耳视频数据集。
Binaural audio provides human listeners with an immersive spatial sound experience, but most existing videos lack binaural audio recordings. We propose an audio spatialization method that draws on visual information in videos to convert their monaural (single-channel) audio to binaural audio. Whereas existing approaches leverage visual features extracted directly from video frames, our approach explicitly disentangles the geometric cues present in the visual stream to guide the learning process. In particular, we develop a multi-task framework that learns geometry-aware features for binaural audio generation by accounting for the underlying room impulse response, the visual stream's coherence with the sound source(s) positions, and the consistency in geometry of the sounding objects over time. Furthermore, we introduce a new large video dataset with realistic binaural audio simulated for real-world scanned environments. On two datasets, we demonstrate the efficacy of our method, which achieves state-of-the-art results.
研究动机与目标
- 为解决大多数视频中缺乏双耳音频的问题,通过利用视觉线索实现从单声道到双耳音频的转换。
- 通过显式建模房间混响响应(RIR)、声源对齐和物体位置的时间一致性等几何因素,提升空间音频的真实性。
- 创建一个大规模、照片级真实感的视频数据集,其中包含模拟的双耳音频,以支持双耳音频生成的训练与评估。
- 证明显式建模几何与空间约束可带来优于隐式视觉特征学习的音频生成效果。
提出的方法
- 提出一种多任务学习框架,联合优化三个目标:从视觉特征预测房间混响响应(RIR),确保视觉与音频源之间的空间一致性,以及在视频帧之间保持声源的几何一致性。
- 使用共享的视觉编码器从视频帧中提取特征,并为 RIR 预测、空间对齐和几何一致性建模分别设计任务特定的头网络。
- 引入损失函数,促使视觉特征能够预测 RIR 参数(如早期反射、衰减时间),并与其在场景中的声源方向保持一致。
- 通过建模声源在时间维度上的几何一致性来实现时间平滑性,防止感知声源位置出现突兀跳变。
- 利用一个新型数据集 SimBinaural,其中包含经过 3D 扫描的室内环境及逼真的双耳音频模拟,用于训练与评估。
- 采用自监督与监督信号相结合的方式端到端训练模型,并引入数据增强和对比学习组件以提升特征泛化能力。
实验结果
研究问题
- RQ1显式建模几何线索(如房间声学特性与声源位置)是否能提升从视频进行单声道到双耳音频转换的性能?
- RQ2在视觉与音频源之间强制实现空间一致性,对生成双耳音频的感知真实感与准确性有何影响?
- RQ3声源在时间维度上的几何一致性在多大程度上提升了视频序列中音频生成的质量?
- RQ4一个大规模、照片级真实感的、包含模拟双耳音频的数据集,是否能增强在真实视频基准上的泛化能力与性能表现?
主要发现
- 在 FAIR-Play 基准测试中,所提方法优于最先进模型,即使在无真实 RIR 监督的情况下,仍取得 PESQ 得分为 1.175 和 STOI 得分为 0.154 的成绩。
- 在 SimBinaural 与 FAIR-Play 联合训练后,该方法在非重叠测试集上表现最佳,证明了合成数据集的泛化优势。
- 用户研究表明,听众在声源方向准确性(左/右/中)和感知双耳音质方面更偏好本方法而非基线模型。
- t-SNE 可视化结果表明,本方法的视觉特征能有效预测 RT60 等声学参数,而基线方法的特征分布则呈现随机分布。
- 激活图分析显示,本方法对发声物体的定位比 APNet 更精确,后者产生弥散且不聚焦的注意力区域。
- 消融实验证实,结合全部三项损失(RIR 预测、空间一致性、几何一致性)可获得最佳性能,验证了多任务设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。