[论文解读] Visually Informed Binaural Audio Generation without Binaural Audios
本文提出 PseudoBinaural,一种无需任何录音双耳数据即可生成视觉引导双耳音频的方法。通过利用球谐分解与头相关 impulse 响应(HRIR)将单声道音频映射为双耳输出,并在对应声源方向手动放置视觉线索,作者构建了用于训练的伪视觉-立体对。该方法在性能上与监督方法相当,并在结合真实双耳数据时进一步提升了最先进水平。
Stereophonic audio, especially binaural audio, plays an essential role in immersive viewing environments. Recent research has explored generating visually guided stereophonic audios supervised by multi-channel audio collections. However, due to the requirement of professional recording devices, existing datasets are limited in scale and variety, which impedes the generalization of supervised methods in real-world scenarios. In this work, we propose PseudoBinaural, an effective pipeline that is free of binaural recordings. The key insight is to carefully build pseudo visual-stereo pairs with mono data for training. Specifically, we leverage spherical harmonic decomposition and head-related impulse response (HRIR) to identify the relationship between spatial locations and received binaural audios. Then in the visual modality, corresponding visual cues of the mono data are manually placed at sound source positions to form the pairs. Compared to fully-supervised paradigms, our binaural-recording-free pipeline shows great stability in cross-dataset evaluation and achieves comparable performance under subjective preference. Moreover, combined with binaural recordings, our method is able to further boost the performance of binaural audio generation under supervised settings.
研究动机与目标
- 解决训练视觉引导音频生成模型时双耳音频数据稀缺且成本高昂的问题。
- 克服在受控、特定房间数据集上训练的监督模型的泛化能力限制。
- 开发一种完全无监督的流程,仅依赖单声道音频与视觉数据实现双耳音频生成。
- 在无需双耳数据的前提下,实现在多样化真实世界与野外场景中的稳定、可泛化的性能。
提出的方法
- 单声道-双耳映射流程利用单声道音频的球谐分解,提取零阶与一阶分量以实现空间音频渲染。
- 应用头相关 impulse 响应(HRIR)将分解后的音频分量转换为任意声源方向的双耳输出。
- 通过预定义的视觉-坐标映射,将视觉线索放置在对应声源方向的球坐标位置上。
- 通过将单声道音频与在估计声源位置处视觉定位的线索相结合,构建伪视觉-立体对。
- 该方法使单声道到双耳的神经网络可在合成的伪数据上进行训练,而无需真实双耳录音。
- 该框架支持混合不同数量声源的数据,并将音频-视觉声源分离作为训练的辅助任务。
实验结果
研究问题
- RQ1是否可以完全不依赖真实双耳录音,仅通过单声道音频与视觉线索有效生成双耳音频?
- RQ2对于给定的单声道音频,声源方向与双耳音频输出之间存在何种理论关系?
- RQ3如何系统性地将视觉线索映射到空间位置,以形成有意义的伪视觉-立体对?
- RQ4伪数据是否能在无监督与监督设置下均提升双耳音频生成的泛化能力与性能?
- RQ5所提出的双耳解码策略在感知质量上与直接使用 HRIR 或混响场解码相比如何?
主要发现
- PseudoBinaural 在主观评价中达到与监督方法(如 Mono2Binaural)相当的性能,用户在 54.7% 的评估中更偏好其立体感。
- 当使用边界方位角为 π/3 时,该方法的 STFT 损失为 0.878,信噪比(SNR)为 5.316,优于其他视觉视场角配置。
- 用户研究表明,PseudoBinaural 的声音定位准确率达到 81%,显著优于基线方法在识别声源位置方面的能力。
- 消融实验表明,结合 HRIR 与混响场解码可获得最佳感知效果,用户在 3D 听觉体验评分中对此组合评价最高。
- 当与真实双耳录音结合时,PseudoBinaural 在标准基准测试中进一步提升了性能,超越当前最先进方法。
- 可视化分析表明,PseudoBinaural 的注意力机制聚焦于实际声源,而 Mono2Binaural 通常关注天花板等无关区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。